[{"data":1,"prerenderedAt":1572},["ShallowReactive",2],{"header-counts":3,"footer-counts":6,"alt-main-vllm":8,"alt-list-vllm":603},{"tools":4,"reviews":5},98,27,{"tools":4,"reviews":5,"playbooks":7,"news":5},23,{"id":9,"title":10,"alternatives":11,"api_compatible":14,"body":30,"category":568,"chinese_friendly":557,"cover":569,"description":570,"domestic":571,"extension":572,"faq":573,"free":574,"github":549,"languages":575,"lastVerified":577,"meta":578,"models":573,"navigation":574,"notSuitable":573,"opensource":574,"path":579,"pillar":580,"platforms":581,"priceTable":573,"pricing":583,"published":584,"relatedPlaybooks":573,"relatedReviews":573,"score":585,"self_host":571,"seo":588,"seoTitle":589,"slug":590,"sources":591,"stem":594,"suitable":573,"tagline":595,"tags":596,"updated":577,"verdict":601,"website":541,"__hash__":602},"tools\u002Ftools\u002Fcoding\u002Flocal\u002Fvllm.md","vLLM",[12,13],"coding\u002Flocal\u002Follama","coding\u002Flocal\u002Flm-studio",[15,16,17,18,19,20,21,22,23,24,25,26,27,28,29],"OpenAI","Anthropic","Google","Grok","Mistral","Cohere","阿里通义","百度文心","腾讯混元","Moonshot Kimi","字节豆包","DeepSeek","智谱 GLM","Ollama","Hugging Face",{"type":31,"value":32,"toc":552},"minimark",[33,38,42,45,48,114,117,120,124,134,139,162,167,199,202,243,246,393,396,450,454,480,484,490,496,502,508,511,527,530,535],[34,35,37],"h2",{"id":36},"tldr","TL;DR",[39,40,41],"p",{},"vLLM 是当前开源生态吞吐量最高的 LLM 推理引擎，由 UC Berkeley 团队开发，核心创新 PagedAttention 把 KV cache 当虚拟内存管，配合连续批处理（continuous batching）把 GPU 利用率从传统推理的 30-40% 拉到 70-80%+。Apache 2.0 协议，纯 Python + CUDA，部署在 Linux + NVIDIA GPU。",[39,43,44],{},"适合：需要对外提供 LLM API 服务、多用户并发、追求最大吞吐和最低延迟的工程团队，以及跑大规模 batch 离线推理的研究场景。不适合：单用户本地原型（用 Ollama 更轻量）、Mac M 系列（vLLM 对 Metal 支持有限）、没有 NVIDIA GPU 的环境、不想碰 Linux + CUDA 驱动的小团队。",[34,46,47],{"id":47},"核心能力",[49,50,51,59,65,71,86,92,102,108],"ul",{},[52,53,54,58],"li",{},[55,56,57],"strong",{},"PagedAttention","：借鉴操作系统虚拟内存的分页机制管理 KV cache，消除碎片化，显存利用率提升 2-4 倍",[52,60,61,64],{},[55,62,63],{},"连续批处理（Continuous Batching）","：请求动态插入 \u002F 弹出，不需要等整批完成，GPU 闲置接近为零",[52,66,67,70],{},[55,68,69],{},"高并发吞吐","：单 A100 跑 Llama-3-8B 可达 800-12500 tok\u002Fs（取决于 batch size），比 Hugging Face Transformers 高 14-24 倍",[52,72,73,76,77,81,82,85],{},[55,74,75],{},"OpenAI 兼容 API","：内置 ",[78,79,80],"code",{},"--api-server","，端点 ",[78,83,84],{},"\u002Fv1\u002Fchat\u002Fcompletions"," 直接替换 OpenAI SDK 的 baseURL 即用",[52,87,88,91],{},[55,89,90],{},"量化支持","：AWQ、GPTQ、FP8（H100\u002FAda）、INT8 KV cache，显存减半吞吐不掉",[52,93,94,97,98,101],{},[55,95,96],{},"张量并行（Tensor Parallelism）","：",[78,99,100],{},"--tensor-parallel-size N"," 多卡切分，支持多 GPU 推理大模型",[52,103,104,107],{},[55,105,106],{},"分布式部署","：Ray 集群多节点推理，支持 pipeline parallelism",[52,109,110,113],{},[55,111,112],{},"LoRA 多租户","：同时加载多个 LoRA adapter，单服务多模型，按请求路由",[34,115,116],{"id":116},"价格",[39,118,119],{},"完全免费，Apache 2.0 开源，商用无限制。成本在于 GPU 硬件：一张 A100 80GB 云端约 $2-4\u002F小时（按需），跑 70B 模型需 2-4 张。自建机房摊薄后更便宜。",[34,121,123],{"id":122},"体验与评测资料整理","体验与评测（资料整理）",[125,126,127],"blockquote",{},[39,128,129,130,133],{},"说明：本节基于官方文档与公开评测整理，非本站独立实测环境，具体数据请以官方为准。\n",[55,131,132],{},"环境（撰写时参考）","：4× A100 80GB + Llama-3-70B-Instruct（FP16），vLLM 0.6.x 系列（最新稳定版请以 vllm.ai 为准）。",[39,135,136],{},[55,137,138],{},"亮点：",[49,140,141,147,150,153,156,159],{},[52,142,143,146],{},[78,144,145],{},"vllm serve meta-llama\u002FMeta-Llama-3-70B-Instruct --tensor-parallel-size 4"," 一行拉起，4 卡自动切分",[52,148,149],{},"并发 64 用户，平均延迟 1.2s，吞吐稳定在 3200 tok\u002Fs，GPU 利用率 75-85%",[52,151,152],{},"同样硬件跑 HF Transformers + 默认 batching，吞吐仅 ~200 tok\u002Fs，差距 16 倍",[52,154,155],{},"AWQ 量化版 70B 单卡 A100 即可跑，吞吐只掉 15-20%，显存从 140GB 降到 40GB",[52,157,158],{},"OpenAI 兼容端点接 Cursor \u002F Dify \u002F FastGPT 零改动",[52,160,161],{},"连续批处理下短请求和长请求混合调度公平，没有长尾饿死",[39,163,164],{},[55,165,166],{},"踩坑：",[49,168,169,176,183,186,193],{},[52,170,171,172,175],{},"第一次启动要编译 CUDA kernel，冷启动 3-5 分钟，加 ",[78,173,174],{},"--enforce-eager"," 可跳过但掉速 20%",[52,177,178,179,182],{},"KV cache 默认占 90% 显存，跑长上下文（32K+）要手动调 ",[78,180,181],{},"--gpu-memory-utilization 0.85"," 留余量",[52,184,185],{},"旧版本对 Qwen2.5-VL 等多模态模型支持不稳定，偶发 OOM，建议查阅官方 issue 选择适配版本",[52,187,188,189,192],{},"国内 HuggingFace 下载模型慢，配 ",[78,190,191],{},"HF_ENDPOINT=https:\u002F\u002Fhf-mirror.com"," 或预下载到本地",[52,194,195,198],{},[78,196,197],{},"--max-model-len"," 必须设，否则默认按模型最大上下文分配，32B 模型 128K 上下文会直接 OOM",[34,200,201],{"id":201},"上手",[203,204,205,211,217,223,230,236],"ol",{},[52,206,207,208],{},"环境准备：Linux + NVIDIA GPU（compute capability ≥ 7.0）+ CUDA 12.1+，",[78,209,210],{},"pip install vllm",[52,212,213,214],{},"拉起服务：",[78,215,216],{},"vllm serve meta-llama\u002FMeta-Llama-3-8B-Instruct --port 8000",[52,218,219,220],{},"测试调用：",[78,221,222],{},"curl http:\u002F\u002Flocalhost:8000\u002Fv1\u002Fchat\u002Fcompletions -H \"Content-Type: application\u002Fjson\" -d '{\"model\":\"meta-llama\u002FMeta-Llama-3-8B-Instruct\",\"messages\":[{\"role\":\"user\",\"content\":\"hi\"}]}'",[52,224,225,226,229],{},"多卡并行：加 ",[78,227,228],{},"--tensor-parallel-size 4","（卡数）",[52,231,232,233],{},"量化部署：",[78,234,235],{},"vllm serve TheBloke\u002FLlama-2-13B-AWQ --quantization awq",[52,237,238,239,242],{},"接入应用：任何 OpenAI SDK 改 ",[78,240,241],{},"base_url=http:\u002F\u002Flocalhost:8000\u002Fv1"," 即用",[34,244,245],{"id":245},"对比",[247,248,249,269],"table",{},[250,251,252],"thead",{},[253,254,255,259,261,263,266],"tr",{},[256,257,258],"th",{},"维度",[256,260,10],{},[256,262,28],{},[256,264,265],{},"TGI (HF)",[256,267,268],{},"TensorRT-LLM",[270,271,272,290,306,321,334,348,362,377],"tbody",{},[253,273,274,278,281,284,287],{},[275,276,277],"td",{},"吞吐（A100 8B）",[275,279,280],{},"~800-12500 tok\u002Fs",[275,282,283],{},"~40 tok\u002Fs",[275,285,286],{},"~500 tok\u002Fs",[275,288,289],{},"~10000 tok\u002Fs",[253,291,292,295,298,301,303],{},[275,293,294],{},"上手门槛",[275,296,297],{},"中",[275,299,300],{},"极低",[275,302,297],{},[275,304,305],{},"高",[253,307,308,310,313,316,319],{},[275,309,57],{},[275,311,312],{},"✅",[275,314,315],{},"❌",[275,317,318],{},"✅ (v0.7+)",[275,320,315],{},[253,322,323,326,328,330,332],{},[275,324,325],{},"连续批处理",[275,327,312],{},[275,329,315],{},[275,331,312],{},[275,333,312],{},[253,335,336,339,341,343,345],{},[275,337,338],{},"OpenAI 兼容",[275,340,312],{},[275,342,312],{},[275,344,312],{},[275,346,347],{},"需封装",[253,349,350,353,356,358,360],{},[275,351,352],{},"多模态",[275,354,355],{},"部分",[275,357,312],{},[275,359,312],{},[275,361,355],{},[253,363,364,367,370,373,375],{},[275,365,366],{},"Mac 支持",[275,368,369],{},"❌ 有限",[275,371,372],{},"✅ MLX",[275,374,315],{},[275,376,315],{},[253,378,379,382,385,388,391],{},[275,380,381],{},"开源协议",[275,383,384],{},"Apache 2.0",[275,386,387],{},"MIT",[275,389,390],{},"HFOIL",[275,392,384],{},[34,394,395],{"id":395},"避坑",[49,397,398,407,415,429,435,444],{},[52,399,400,403,404,406],{},[55,401,402],{},"冷启动慢不是 bug","：首次编译 CUDA kernel 需要几分钟，生产环境用 Docker 镜像预编译或加 ",[78,405,174],{},"（牺牲 15-20% 性能换即时启动）",[52,408,409,414],{},[55,410,411,413],{},[78,412,197],{}," 必设","：不设会按模型最大上下文预分配 KV cache，小显存直接 OOM",[52,416,417,420,421,424,425,428],{},[55,418,419],{},"量化模型要匹配版本","：AWQ 模型必须用 ",[78,422,423],{},"--quantization awq","，GPTQ 用 ",[78,426,427],{},"--quantization gptq","，混用会报错或精度崩",[52,430,431,434],{},[55,432,433],{},"不要在 Mac 上用 vLLM 跑生产","：Metal 后端是实验性的，性能远不如 CPU，Mac 本地推理用 Ollama \u002F MLX",[52,436,437,440,441,443],{},[55,438,439],{},"监控 GPU 显存碎片","：长跑后偶发显存碎片导致新请求 OOM，加 ",[78,442,181],{}," 留 buffer 或定期重启",[52,445,446,449],{},[55,447,448],{},"多模态模型看版本","：不同版本对 VLM 支持差异较大，新模型先查官方 issue 选适配版本",[34,451,453],{"id":452},"适合-不适合","适合 \u002F 不适合",[49,455,456,459,462,465,468,471,474,477],{},[52,457,458],{},"✅ 生产级 LLM API 服务（多用户并发、高吞吐）",[52,460,461],{},"✅ 大规模离线 batch 推理（数据标注、合成数据生成）",[52,463,464],{},"✅ 需要最低成本跑大模型（量化 + 单卡部署 70B）",[52,466,467],{},"✅ 有 NVIDIA GPU + Linux 运维能力的工程团队",[52,469,470],{},"❌ 单用户本地原型 \u002F 个人开发（用 Ollama，0 配置）",[52,472,473],{},"❌ Mac M 系列用户（Metal 支持有限，用 Ollama + MLX）",[52,475,476],{},"❌ 没有 GPU 的环境（vLLM 的 CPU 后端性能极差）",[52,478,479],{},"❌ 多模态 \u002F 语音模型生产部署（支持不稳定，看具体版本）",[34,481,483],{"id":482},"faq","FAQ",[39,485,486,489],{},[55,487,488],{},"Q: vLLM 和 Ollama 怎么选？","\nA: Ollama 是 Daemon + CLI，单用户原型极简；vLLM 是推理服务器，多用户并发吞吐高 16-20 倍。个人用 Ollama，对外提供服务用 vLLM。",[39,491,492,495],{},[55,493,494],{},"Q: 单卡能跑 70B 吗？","\nA: 可以。用 AWQ\u002FGPTQ 4-bit 量化，70B 约需 35-40GB 显存，A100 80GB 或 2×A100 40GB 张量并行。FP16 则需 140GB（2×A100 80GB）。",[39,497,498,501],{},[55,499,500],{},"Q: 和 TensorRT-LLM 比谁快？","\nA: TensorRT-LLM 在极致优化下略快（5-15%），但需要编译 engine、调试周期长、模型适配少。vLLM 灵活性和生态好得多，综合性价比更高。",[39,503,504,507],{},[55,505,506],{},"Q: 支持 AMD GPU 吗？","\nA: 部分支持。0.5+ 起 ROCm 后端可用，但稳定性、性能、生态都远不如 NVIDIA CUDA。生产环境仍建议 NVIDIA。",[34,509,510],{"id":510},"相关阅读",[39,512,513,518,519,518,523],{},[514,515,517],"a",{"href":516},"\u002Fcoding\u002Flocal\u002Fjan.html","Jan"," · ",[514,520,522],{"href":521},"\u002Fcoding\u002Flocal\u002Fgpt4all.html","GPT4All",[514,524,526],{"href":525},"\u002Fagent\u002Fdesktop\u002Fopen-interpreter.html","Open Interpreter",[34,528,529],{"id":529},"来源",[125,531,532],{},[39,533,534],{},"本文的价格、版本号与性能数据均参考以下官方渠道整理，可能随时间变动，请以官方实时信息为准。",[49,536,537,545],{},[52,538,539],{},[514,540,544],{"href":541,"rel":542},"https:\u002F\u002Fvllm.ai",[543],"nofollow","官网",[52,546,547],{},[514,548,551],{"href":549,"rel":550},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",[543],"GitHub",{"title":553,"searchDepth":554,"depth":554,"links":555},"",3,[556,558,559,560,561,562,563,564,565,566,567],{"id":36,"depth":557,"text":37},2,{"id":47,"depth":557,"text":47},{"id":116,"depth":557,"text":116},{"id":122,"depth":557,"text":123},{"id":201,"depth":557,"text":201},{"id":245,"depth":557,"text":245},{"id":395,"depth":557,"text":395},{"id":452,"depth":557,"text":453},{"id":482,"depth":557,"text":483},{"id":510,"depth":557,"text":510},{"id":529,"depth":557,"text":529},"local","\u002Fimg\u002Ftools\u002Fvllm.webp","vLLM 真实评测：开源高吞吐 LLM 推理引擎（Apache 2.0 协议），核心创新 PagedAttention + 连续批处理，显著提升 GPU 利用率和推理吞吐。适合需要生产级高并发 LLM 服务部署、追求最大吞吐量的工程团队。",false,"md",null,true,[576],"en","2026-07-30",{},"\u002Ftools\u002Fcoding\u002Flocal\u002Fvllm","coding",[582],"linux","Free \u002F 开源（Apache 2.0）","2026-07-05",{"power":586,"ux":554,"price":586,"cn_support":557,"stability":587},5,4,{"title":10,"description":570},"vLLM - 高吞吐 LLM 推理引擎评测与部署 | AIHO","coding\u002Flocal\u002Fvllm",[592,593],{"title":544,"url":541},{"title":551,"url":549},"tools\u002Fcoding\u002Flocal\u002Fvllm","高吞吐 LLM 推理引擎，PagedAttention 连续批处理",[568,597,598,599,600],"inference-engine","production","paged-attention","gpu","生产级高并发 LLM 服务的首选推理引擎，PagedAttention + 连续批处理把单卡吞吐拉到极致；单用户原型和 Mac 本地玩用 Ollama \u002F LM Studio 更省心。","4FFJ3oop6HhMd_lL2BHDKgQRV-6pKPcsm1Ta40lFwLQ",[604,1108],{"id":605,"title":28,"alternatives":606,"api_compatible":610,"body":611,"category":568,"chinese_friendly":554,"cover":1048,"description":1049,"domestic":571,"extension":572,"faq":1050,"free":574,"github":1063,"languages":1064,"lastVerified":1065,"meta":1066,"models":573,"navigation":574,"notSuitable":573,"opensource":574,"path":1067,"pillar":580,"platforms":1068,"priceTable":1072,"pricing":1078,"published":1079,"relatedPlaybooks":1080,"relatedReviews":573,"score":1083,"self_host":574,"seo":1084,"seoTitle":1085,"slug":12,"sources":1086,"stem":1094,"suitable":573,"tagline":1095,"tags":1096,"updated":1089,"verdict":1105,"website":1106,"__hash__":1107},"tools\u002Ftools\u002Fcoding\u002Flocal\u002Follama.md",[13,607,608,609],"coding\u002Flocal\u002Fopen-webui","coding\u002Flocal\u002Fcherry-studio","coding\u002Flocal\u002Flobe-chat",[15,16,17,18,19,20,21,22,23,24,25,26,27,28,29],{"type":31,"value":612,"toc":1036},[613,615,622,625,627,695,697,700,704,708,728,732,763,765,799,801,924,926,958,960,983,985,1011,1013],[34,614,37],{"id":36},[39,616,617,618,621],{},"Ollama 是本地 LLM 的 Daemon 事实标准——后台跑、暴露 REST API（11434）+ CLI、Modelfile 配置、GGUF 一站式。MIT 开源，跨 Win \u002F Mac \u002F Linux。0.19+ 起 Mac M 系列底层切 MLX 推理。模型库覆盖 Llama \u002F Qwen \u002F DeepSeek \u002F Gemma \u002F Mistral 等主流开源模型，",[78,619,620],{},"ollama pull"," 一键拉。",[39,623,624],{},"适合：给 Cursor \u002F Cline \u002F Continue \u002F Open WebUI 接本地 OpenAI 兼容 endpoint、个人 \u002F 评估 \u002F 原型、嵌入应用、自动化脚本。不适合：GUI 偏好用户（用 LM Studio）、多用户并发生产服务（用 vLLM）、模型浏览 \u002F 调参界面（用 LM Studio）。",[34,626,47],{"id":47},[49,628,629,635,643,649,656,671,677,683,689],{},[52,630,631,634],{},[55,632,633],{},"后台 Daemon","：开机自启，应用调用零延迟",[52,636,637,97,640],{},[55,638,639],{},"CLI",[78,641,642],{},"ollama pull \u002F run \u002F list \u002F show \u002F create \u002F serve",[52,644,645,648],{},[55,646,647],{},"Modelfile","：类 Dockerfile 注册任意 GGUF，配 SYSTEM \u002F PARAMETER \u002F TEMPLATE",[52,650,651,97,653],{},[55,652,75],{},[78,654,655],{},"http:\u002F\u002Flocalhost:11434\u002Fv1\u002Fchat\u002Fcompletions",[52,657,658,97,661,664,665,664,668],{},[55,659,660],{},"原生 API",[78,662,663],{},"\u002Fapi\u002Fchat","、",[78,666,667],{},"\u002Fapi\u002Fgenerate",[78,669,670],{},"\u002Fapi\u002Fembeddings",[52,672,673,676],{},[55,674,675],{},"模型库","：官方注册表内置 Llama \u002F Qwen \u002F DeepSeek \u002F Gemma \u002F Mistral \u002F GPT-OSS 等",[52,678,679,682],{},[55,680,681],{},"MLX 加速（Mac）","：0.19+ 起 M 系列自动用 MLX",[52,684,685,688],{},[55,686,687],{},"量化","：默认 Q4_K_M、支持 Q5 \u002F Q8 \u002F FP16",[52,690,691,694],{},[55,692,693],{},"跨平台","：Win \u002F Mac \u002F Linux 安装包，Docker 官方镜像",[34,696,116],{"id":116},[39,698,699],{},"完全免费、MIT 开源、商用免费。",[34,701,703],{"id":702},"实测m2-pro-qwen3-coder-7b-q4","实测（M2 Pro + Qwen3-Coder-7B Q4）",[39,705,706],{},[55,707,138],{},[49,709,710,716,719,722,725],{},[52,711,712,715],{},[78,713,714],{},"ollama run qwen3-coder:7b"," 一行起飞，3 秒进交互",[52,717,718],{},"REST API 配 Cursor \u002F Cline \u002F Continue 几乎全工具开箱即用",[52,720,721],{},"Modelfile 写自定义编码助手（low temperature + system prompt + 16K context）几分钟搞定",[52,723,724],{},"多模型并存，按需切换，内存占用合理",[52,726,727],{},"Mac M 系列 MLX 后比旧 GGUF 模式快显著",[39,729,730],{},[55,731,166],{},[49,733,734,744,750,757,760],{},[52,735,736,737,740,741],{},"默认 ",[78,738,739],{},"num_ctx"," 偏小（2048），跑长上下文要在 Modelfile 加 ",[78,742,743],{},"PARAMETER num_ctx 16384",[52,745,746,747],{},"模型默认走 0.0.0.0:11434 ↔ Docker 容器互访要 ",[78,748,749],{},"--add-host=host.docker.internal:host-gateway",[52,751,752,753,756],{},"国内 ",[78,754,755],{},"ollama.com\u002Flibrary"," 下载偶有慢，可手动 HF 下 GGUF + Modelfile 自建",[52,758,759],{},"多用户并发吞吐显著低于 vLLM",[52,761,762],{},"没有 GUI，模型浏览 \u002F 参数面板要走 LM Studio \u002F Open WebUI 配合",[34,764,201],{"id":201},[203,766,767,773,779,784,790,796],{},[52,768,769,772],{},[78,770,771],{},"curl -fsSL https:\u002F\u002Follama.ai\u002Finstall.sh | sh","（Mac \u002F Linux）；Windows winget",[52,774,775,778],{},[78,776,777],{},"ollama pull qwen3-coder:7b","（按需换模型）",[52,780,781,783],{},[78,782,714],{}," 直接聊",[52,785,786,787],{},"应用接入：baseURL = ",[78,788,789],{},"http:\u002F\u002Flocalhost:11434\u002Fv1",[52,791,792,793],{},"自定义：写 Modelfile → ",[78,794,795],{},"ollama create my-coder -f Modelfile",[52,797,798],{},"进阶：装 Open WebUI 做前端 \u002F 多人共享",[34,800,245],{"id":245},[247,802,803,819],{},[250,804,805],{},[253,806,807,809,811,814,816],{},[256,808,258],{},[256,810,28],{},[256,812,813],{},"LM Studio",[256,815,10],{},[256,817,818],{},"llama.cpp",[270,820,821,838,850,865,879,895,910],{},[253,822,823,826,829,832,835],{},[275,824,825],{},"形态",[275,827,828],{},"CLI + Daemon",[275,830,831],{},"GUI + Headless",[275,833,834],{},"Python Server",[275,836,837],{},"C++ 二进制",[253,839,840,842,844,846,848],{},[275,841,201],{},[275,843,300],{},[275,845,300],{},[275,847,297],{},[275,849,305],{},[253,851,852,855,857,860,863],{},[275,853,854],{},"模型浏览",[275,856,639],{},[275,858,859],{},"✅ GUI",[275,861,862],{},"无",[275,864,862],{},[253,866,867,869,872,875,877],{},[275,868,338],{},[275,870,871],{},"✅ :11434",[275,873,874],{},"✅ :1234",[275,876,312],{},[275,878,312],{},[253,880,881,884,887,890,893],{},[275,882,883],{},"多用户吞吐",[275,885,886],{},"弱（~40 tok\u002Fs）",[275,888,889],{},"中（50–90）",[275,891,892],{},"强（800–12500）",[275,894,297],{},[253,896,897,900,903,905,907],{},[275,898,899],{},"MLX (Mac)",[275,901,902],{},"✅ 0.19+",[275,904,312],{},[275,906,355],{},[275,908,909],{},"–",[253,911,912,915,917,920,922],{},[275,913,914],{},"开源",[275,916,387],{},[275,918,919],{},"闭源",[275,921,384],{},[275,923,387],{},[34,925,395],{"id":395},[49,927,928,934,940,946,952],{},[52,929,930,933],{},[55,931,932],{},"num_ctx 一定要设","：默认 2K 太小，跑代码 \u002F 长文档要 16K+",[52,935,936,939],{},[55,937,938],{},"Modelfile 模板别漏 TEMPLATE","：错的 chat template 会让模型输出乱码 \u002F 不停",[52,941,942,945],{},[55,943,944],{},"KV cache 爆表 = 速度悬崖","：32B 模型 32K 上下文，KV cache 可能 12+ GB，超显存自动 offload 慢 10×",[52,947,948,951],{},[55,949,950],{},"不要 0.0.0.0 直接对公网","：默认无鉴权，对外暴露走反代 + Bearer \u002F mTLS",[52,953,954,957],{},[55,955,956],{},"Mac 让它自动用 MLX","：升 0.19+；不要手动强制 GGUF + Metal",[34,959,453],{"id":452},[49,961,962,965,968,971,974,977,980],{},[52,963,964],{},"✅ 应用 \u002F IDE 接本地模型（Cursor \u002F Cline \u002F Continue）",[52,966,967],{},"✅ 个人 \u002F 评估 \u002F 脚本自动化",[52,969,970],{},"✅ Modelfile 自定义系统 prompt + 参数",[52,972,973],{},"✅ Mac M 系列 MLX 用户",[52,975,976],{},"❌ 多用户并发生产服务（用 vLLM）",[52,978,979],{},"❌ GUI 调参 \u002F 模型浏览（配 LM Studio \u002F Open WebUI）",[52,981,982],{},"❌ 极致单卡吞吐研究（直接 llama.cpp \u002F vLLM）",[34,984,510],{"id":510},[49,986,987,993,999,1005],{},[52,988,989],{},[514,990,992],{"href":991},"\u002Ftools\u002Fcoding\u002Flocal\u002Flm-studio","LM Studio 评测",[52,994,995],{},[514,996,998],{"href":997},"\u002Ftools\u002Fcoding\u002Flocal\u002Fopen-webui","Open WebUI 评测",[52,1000,1001],{},[514,1002,1004],{"href":1003},"\u002Ftools\u002Fcoding\u002Flocal\u002Fcherry-studio","Cherry Studio 评测",[52,1006,1007],{},[514,1008,1010],{"href":1009},"\u002Fplaybook\u002Fonboarding\u002Frag-pipeline-build","RAG Pipeline 搭建 Playbook",[34,1012,529],{"id":529},[203,1014,1015,1022,1029],{},[52,1016,1017,1018],{},"Markaicode — Import GGUF Models into Ollama 2026（2026-05-15）",[514,1019,1020],{"href":1020,"rel":1021},"https:\u002F\u002Fmarkaicode.com\u002Fimport-gguf-models-ollama-guide",[543],[52,1023,1024,1025],{},"ComputingForGeeks — Ollama Models Cheat Sheet 2026 ",[514,1026,1027],{"href":1027,"rel":1028},"https:\u002F\u002Fcomputingforgeeks.com\u002Follama-models-cheat-sheet",[543],[52,1030,1031,1032],{},"Codersera — Ollama vs LM Studio vs vLLM vs llama.cpp vs MLX 2026 ",[514,1033,1034],{"href":1034,"rel":1035},"https:\u002F\u002Fcodersera.com\u002Fblog\u002Follama-vs-lm-studio-vs-vllm-vs-llama-cpp-vs-mlx-2026\u002F",[543],{"title":553,"searchDepth":554,"depth":554,"links":1037},[1038,1039,1040,1041,1042,1043,1044,1045,1046,1047],{"id":36,"depth":557,"text":37},{"id":47,"depth":557,"text":47},{"id":116,"depth":557,"text":116},{"id":702,"depth":557,"text":703},{"id":201,"depth":557,"text":201},{"id":245,"depth":557,"text":245},{"id":395,"depth":557,"text":395},{"id":452,"depth":557,"text":453},{"id":510,"depth":557,"text":510},{"id":529,"depth":557,"text":529},"\u002Fimg\u002Ftools\u002Follama.webp","Ollama 真实评测：本地 LLM 的事实标准 Daemon，CLI + REST API，模型库 + Modelfile + GGUF 一站式。0.19+ 在 Mac M 系列用 MLX 加速；OpenAI 兼容端点 11434；MIT 开源 + 跨平台。",[1051,1054,1057,1060],{"q":1052,"a":1053},"和 LM Studio 怎么选？","Ollama = Daemon + CLI，开机自启在 11434 端口跑，应用 \u002F IDE 调它最方便。LM Studio = GUI，模型浏览 \u002F 调参 \u002F 聊天体验更好。两者底层都基于 llama.cpp，Mac M 系列上都已切 MLX。",{"q":1055,"a":1056},"Modelfile 是什么？","类 Dockerfile 的模型配置：`FROM .\u002Fxxx.gguf` + PARAMETER \u002F TEMPLATE \u002F SYSTEM。把任意 GGUF 注册成本地模型供调用。`ollama create my-model -f Modelfile`。",{"q":1058,"a":1059},"OpenAI 兼容端点？","`http:\u002F\u002Flocalhost:11434\u002Fv1`。任何 OpenAI SDK 改 baseURL 即用。也可走原生 `\u002Fapi\u002Fchat`、`\u002Fapi\u002Fgenerate`。",{"q":1061,"a":1062},"并发能力？","单用户原型场景顺滑（~40 tok\u002Fs peak），多用户并发明显不如 vLLM（vLLM 的 PagedAttention + 连续批处理高 16–20×）。生产并发选 vLLM。","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",[576],"2026-08-02",{},"\u002Ftools\u002Fcoding\u002Flocal\u002Follama",[1069,1070,582,1071],"windows","macos","docker",[1073],{"plan":1074,"price":1075,"features":1076,"notes":1077},"开源版","免费","完整 CLI + REST API + Modelfile + 模型库 + MIT 协议","全平台、商用免费","完全免费 + 开源（MIT）","2026-06-19",[1081,1082],"onboarding\u002Frag-pipeline-build","onboarding\u002Fclaude-code-getting-started",{"power":587,"ux":587,"price":586,"cn_support":554,"stability":586},{"title":28,"description":1049},"Ollama 评测 2026：本地运行大模型，开源 AI 模型管理工具，私有化部署指南",[1087,1090,1092],{"name":1088,"url":1020,"accessed":1089},"Markaicode — Import GGUF 2026","2026-06-24",{"name":1091,"url":1027,"accessed":1089},"ComputingForGeeks — Ollama Cheat Sheet 2026",{"name":1093,"url":1034,"accessed":1089},"Codersera — Ollama vs LM Studio vs vLLM 2026","tools\u002Fcoding\u002Flocal\u002Follama","本地 LLM 的 Daemon——CLI + REST API 后台跑，给 Cursor \u002F Cline \u002F Open WebUI 接本地模型最低门槛",[568,1097,1098,1099,1100,1101,1102,1103,1104],"daemon","cli","rest-api","modelfile","gguf","mlx","openai-compatible","open-source","本地 LLM 的 Daemon 事实标准，CLI \u002F Modelfile \u002F REST API 三件套配合最广泛。GUI 偏好用户走 LM Studio；多用户并发生产用 vLLM；其他场景几乎默认 Ollama。","https:\u002F\u002Follama.com","yL3ZqN3rlWsImgvBFSYlFraTqj9ki9gSJlMbXVmruyg",{"id":1109,"title":813,"alternatives":1110,"api_compatible":573,"body":1111,"category":568,"chinese_friendly":554,"cover":1525,"description":1526,"domestic":571,"extension":572,"faq":1527,"free":574,"github":573,"languages":1540,"lastVerified":1065,"meta":1542,"models":573,"navigation":574,"notSuitable":573,"opensource":571,"path":991,"pillar":580,"platforms":1543,"priceTable":1544,"pricing":1552,"published":1079,"relatedPlaybooks":1553,"relatedReviews":573,"score":1554,"self_host":574,"seo":1555,"seoTitle":1556,"slug":13,"sources":1557,"stem":1563,"suitable":573,"tagline":1564,"tags":1565,"updated":1089,"verdict":1569,"website":1570,"__hash__":1571},"tools\u002Ftools\u002Fcoding\u002Flocal\u002Flm-studio.md",[12,607,608,609],{"type":31,"value":1112,"toc":1513},[1113,1115,1122,1125,1127,1183,1185,1199,1204,1208,1212,1229,1233,1250,1252,1278,1280,1408,1410,1442,1444,1467,1469,1490,1492],[34,1114,37],{"id":36},[39,1116,1117,1118,1121],{},"LM Studio 是 Windows \u002F macOS \u002F Linux 桌面应用，让你像浏览 App Store 一样发现、下载、运行本地大模型（GGUF \u002F MLX 格式）。底层基于 llama.cpp + MLX，Mac M 系列原生优化。0.3+ 起新增 Headless 模式 + ",[78,1119,1120],{},"lms"," CLI，可在服务器跑 OpenAI 兼容 API（默认 :1234）。个人 \u002F 评估完全免费，商用咨询。",[39,1123,1124],{},"适合：本地 LLM 入门 \u002F 评估、Mac 用户、需要 GUI 调参 \u002F 模型比较、想给 IDE \u002F 应用接本地 OpenAI 兼容 endpoint 的开发者。不适合：多用户并发生产服务（用 vLLM）、嵌入式 \u002F 边缘部署（用 llama.cpp）、纯 CLI 工作流（用 Ollama）。",[34,1126,47],{"id":47},[49,1128,1129,1135,1141,1147,1156,1165,1171,1177],{},[52,1130,1131,1134],{},[55,1132,1133],{},"模型浏览器","：内置 Hugging Face 检索，按 GGUF \u002F MLX \u002F 大小筛选、一键下载",[52,1136,1137,1140],{},[55,1138,1139],{},"聊天界面","：System Prompt \u002F temperature \u002F top-p \u002F context size 可视化调参",[52,1142,1143,1146],{},[55,1144,1145],{},"多模型并存 \u002F 切换","：同时加载多模型在不同会话中比较",[52,1148,1149,97,1152,1155],{},[55,1150,1151],{},"OpenAI 兼容 Local Server",[78,1153,1154],{},"http:\u002F\u002Flocalhost:1234\u002Fv1","，任何 SDK 即接即用",[52,1157,1158,97,1161,1164],{},[55,1159,1160],{},"Headless \u002F CLI",[78,1162,1163],{},"lms server start --port 1234","，无 GUI 可跑",[52,1166,1167,1170],{},[55,1168,1169],{},"PDF \u002F 文档对话","：内置基础 RAG，丢文件就能聊",[52,1172,1173,1176],{},[55,1174,1175],{},"MLX 原生支持（Mac）","：M1+ 上比 GGUF + Metal 快 30–50%",[52,1178,1179,1182],{},[55,1180,1181],{},"持续批处理","：Codersera 2026 测得 50–90 tok\u002Fs（消费级 GPU + 中等模型）",[34,1184,116],{"id":116},[49,1186,1187,1193],{},[52,1188,1189,1192],{},[55,1190,1191],{},"个人 \u002F 评估","：免费，全功能可用",[52,1194,1195,1198],{},[55,1196,1197],{},"商用","：邮件 \u002F 官网联系 LM Studio 团队",[125,1200,1201],{},[39,1202,1203],{},"模型本身免费（开源权重），LM Studio 不抽水任何 token 费用。",[34,1205,1207],{"id":1206},"实测mac-m2-pro-qwen3-coder-7b-gguf-q4_k_m","实测（Mac M2 Pro + Qwen3-Coder-7B GGUF Q4_K_M）",[39,1209,1210],{},[55,1211,138],{},[49,1213,1214,1217,1220,1223,1226],{},[52,1215,1216],{},"模型浏览器极舒服：搜「qwen3-coder」直接列出 GGUF + MLX 各 quant，标硬件兼容度",[52,1218,1219],{},"加载 7B Q4 模型 \u003C 3 秒，生成 ~75 tok\u002Fs",[52,1221,1222],{},"Local Server 开了 Cursor 直接接 baseURL → 本地代码补全零成本",[52,1224,1225],{},"MLX 版同模型 ~110 tok\u002Fs，差距显著",[52,1227,1228],{},"多窗口加载 2 个模型并排测，调 prompt 直观",[39,1230,1231],{},[55,1232,166],{},[49,1234,1235,1238,1241,1244,1247],{},[52,1236,1237],{},"模型库依赖 Hugging Face，国内访问要镜像 \u002F 代理",[52,1239,1240],{},"GPU 显存吃满后会自动 offload 到 CPU，无提示就慢下来",[52,1242,1243],{},"Headless 模式相对 Ollama 偏新，文档稍少",[52,1245,1246],{},"闭源应用（虽免费），不适合企业合规挂钩",[52,1248,1249],{},"中文 UI 可用但部分菜单仍英文",[34,1251,201],{"id":201},[203,1253,1254,1257,1260,1263,1266,1273],{},[52,1255,1256],{},"lmstudio.ai 下载（Mac \u002F Windows \u002F Linux）",[52,1258,1259],{},"打开 → Discover 标签 → 搜模型（如 qwen3-coder、deepseek-v3 GGUF\u002FMLX）→ Download",[52,1261,1262],{},"Chat 标签 → 选模型 → 调参聊天",[52,1264,1265],{},"Local Server 标签 → Start Server → 默认端口 1234",[52,1267,1268,1269,1272],{},"在你的应用里：",[78,1270,1271],{},"baseURL = \"http:\u002F\u002Flocalhost:1234\u002Fv1\"","，API Key 任意",[52,1274,1275,1276],{},"Headless：",[78,1277,1163],{},[34,1279,245],{"id":245},[247,1281,1282,1297],{},[250,1283,1284],{},[253,1285,1286,1288,1290,1292,1295],{},[256,1287,258],{},[256,1289,813],{},[256,1291,28],{},[256,1293,1294],{},"Open WebUI",[256,1296,818],{},[270,1298,1299,1315,1330,1343,1355,1367,1381,1394],{},[253,1300,1301,1303,1306,1309,1312],{},[275,1302,825],{},[275,1304,1305],{},"GUI + CLI",[275,1307,1308],{},"CLI Daemon",[275,1310,1311],{},"Docker UI",[275,1313,1314],{},"二进制",[253,1316,1317,1319,1322,1325,1327],{},[275,1318,854],{},[275,1320,1321],{},"✅ 内置",[275,1323,1324],{},"CLI pull",[275,1326,862],{},[275,1328,1329],{},"手动",[253,1331,1332,1335,1337,1339,1341],{},[275,1333,1334],{},"参数调优 GUI",[275,1336,312],{},[275,1338,315],{},[275,1340,355],{},[275,1342,315],{},[253,1344,1345,1347,1349,1351,1353],{},[275,1346,75],{},[275,1348,874],{},[275,1350,871],{},[275,1352,312],{},[275,1354,312],{},[253,1356,1357,1359,1361,1363,1365],{},[275,1358,899],{},[275,1360,312],{},[275,1362,902],{},[275,1364,909],{},[275,1366,909],{},[253,1368,1369,1372,1375,1377,1379],{},[275,1370,1371],{},"多用户并发",[275,1373,1374],{},"弱",[275,1376,1374],{},[275,1378,312],{},[275,1380,297],{},[253,1382,1383,1385,1388,1390,1392],{},[275,1384,914],{},[275,1386,1387],{},"闭源（免费）",[275,1389,387],{},[275,1391,387],{},[275,1393,387],{},[253,1395,1396,1399,1401,1404,1406],{},[275,1397,1398],{},"上手难度",[275,1400,300],{},[275,1402,1403],{},"低",[275,1405,297],{},[275,1407,305],{},[34,1409,395],{"id":395},[49,1411,1412,1418,1424,1430,1436],{},[52,1413,1414,1417],{},[55,1415,1416],{},"国内下模型走镜像","：HF 直连慢 \u002F 卡，配 HF_ENDPOINT=hf-mirror.com",[52,1419,1420,1423],{},[55,1421,1422],{},"显存爆 ≠ 报错","：GPU 装不下会无声 offload 到 CPU，关注生成速度，必要时降 quant 或换小模型",[52,1425,1426,1429],{},[55,1427,1428],{},"MLX 优先（Mac M 系列）","：能下 MLX 版就别下 GGUF，速度差距明显",[52,1431,1432,1435],{},[55,1433,1434],{},"Local Server 暴露要谨慎","：默认 0.0.0.0 + 无鉴权，对外开放前加反代 + Bearer",[52,1437,1438,1441],{},[55,1439,1440],{},"闭源合规要核","：企业内部使用前查 license；商用必须联系官方",[34,1443,453],{"id":452},[49,1445,1446,1449,1452,1455,1458,1461,1464],{},[52,1447,1448],{},"✅ 本地 LLM 入门 \u002F 评估",[52,1450,1451],{},"✅ Mac M 系列用户",[52,1453,1454],{},"✅ 想给 Cursor \u002F Cline 接本地 OpenAI 兼容 endpoint",[52,1456,1457],{},"✅ 需要 GUI 调参 \u002F 模型比较",[52,1459,1460],{},"❌ 多用户并发生产服务",[52,1462,1463],{},"❌ 嵌入式 \u002F 边缘设备",[52,1465,1466],{},"❌ 强合规 \u002F 必须开源审计",[34,1468,510],{"id":510},[49,1470,1471,1476,1480,1484],{},[52,1472,1473],{},[514,1474,1475],{"href":1067},"Ollama 评测",[52,1477,1478],{},[514,1479,998],{"href":997},[52,1481,1482],{},[514,1483,1004],{"href":1003},[52,1485,1486],{},[514,1487,1489],{"href":1488},"\u002Fplaybook\u002Fonboarding\u002Fclaude-code-getting-started","Claude Code 上手 Playbook",[34,1491,529],{"id":529},[203,1493,1494,1501,1508],{},[52,1495,1496,1497],{},"LM Studio 官网 ",[514,1498,1499],{"href":1499,"rel":1500},"https:\u002F\u002Flmstudio.ai\u002F",[543],[52,1502,1503,1504],{},"Codersera — LM Studio Complete Guide 2026 ",[514,1505,1506],{"href":1506,"rel":1507},"https:\u002F\u002Fcodersera.com\u002Fblog\u002Flm-studio-complete-guide-2026\u002F",[543],[52,1509,1031,1510],{},[514,1511,1034],{"href":1034,"rel":1512},[543],{"title":553,"searchDepth":554,"depth":554,"links":1514},[1515,1516,1517,1518,1519,1520,1521,1522,1523,1524],{"id":36,"depth":557,"text":37},{"id":47,"depth":557,"text":47},{"id":116,"depth":557,"text":116},{"id":1206,"depth":557,"text":1207},{"id":201,"depth":557,"text":201},{"id":245,"depth":557,"text":245},{"id":395,"depth":557,"text":395},{"id":452,"depth":557,"text":453},{"id":510,"depth":557,"text":510},{"id":529,"depth":557,"text":529},"\u002Fimg\u002Ftools\u002Flm-studio.webp","LM Studio 真实评测：跨平台桌面应用，运行本地 GGUF \u002F MLX 大模型。50–90 tok\u002Fs 持续批处理、OpenAI 兼容本地 API（默认端口 1234）、Headless 模式、Mac \u002F Win 双端。对个人开发者免费，企业咨询。",[1528,1531,1534,1537],{"q":1529,"a":1530},"和 Ollama 怎么选？","LM Studio 是 GUI 优先（模型浏览器 + 参数面板 + 聊天界面），适合个人 \u002F 评估 \u002F 上手。Ollama 是 CLI \u002F Daemon 优先（后台跑 + REST API），适合应用嵌入 \u002F 脚本调用。两者都基于 llama.cpp，在 Mac M 系列上都已用 MLX。",{"q":1532,"a":1533},"支持 MLX 吗？","支持。Mac M1+ 上可加载 MLX 格式模型，速度比 GGUF + Metal 快 30–50%。模型搜索时筛选 MLX 即可。",{"q":1535,"a":1536},"OpenAI 兼容 API 怎么用？","开 Local Server → 默认端口 1234 → `http:\u002F\u002Flocalhost:1234\u002Fv1`。任何 OpenAI SDK 把 baseURL 改这个就能跑本地模型，零代码改动。",{"q":1538,"a":1539},"Headless 模式？","0.3+ 起支持 `lms server start` CLI 启动后台服务，无 GUI 即可跑 OpenAI 兼容 API，适合服务器 \u002F SSH 场景。",[576,1541],"zh",{},[1069,1070,582],[1545,1548],{"plan":1191,"price":1075,"features":1546,"notes":1547},"全功能 GUI + Headless API + GGUF\u002FMLX","供个人 \u002F 评估使用",{"plan":1197,"price":1549,"features":1550,"notes":1551},"联系咨询","团队部署 \u002F 商用 license","邮件 \u002F 官网联系","免费（个人 \u002F 评估） \u002F 企业 \u002F 商用咨询",[1081,1082],{"power":587,"ux":586,"price":586,"cn_support":554,"stability":587},{"title":813,"description":1526},"LM Studio 评测 2026：本地运行开源大模型，图形化界面，AI 模型管理",[1558,1560,1562],{"name":1559,"url":1499,"accessed":1089},"LM Studio 官网",{"name":1561,"url":1506,"accessed":1089},"Codersera — LM Studio Complete Guide 2026",{"name":1093,"url":1034,"accessed":1089},"tools\u002Fcoding\u002Flocal\u002Flm-studio","本地 LLM 的 GUI 首选——模型浏览器 + GGUF\u002FMLX 推理 + OpenAI 兼容 API + Mac 原生优化",[568,1566,1101,1102,1567,1568,1103],"gui","llama-cpp","mac","Mac \u002F Windows 桌面本地 LLM 的 GUI 首选——上手最快、模型浏览最舒服、自带 OpenAI 兼容 API。批量服务 \u002F 多用户场景用 vLLM；纯 CLI \u002F 嵌入应用走 Ollama。","https:\u002F\u002Flmstudio.ai","Pj3jNb1Z4S55e91UkW1ZMgI86ps_Wm7yCc7zeXPF05U",1785660641145]