[{"data":1,"prerenderedAt":1089},["ShallowReactive",2],{"header-counts":3,"footer-counts":6,"compare-ollama-vs-vllm":8,"compare-a-ollama":9,"compare-b-vllm":566},{"tools":4,"reviews":5},98,27,{"tools":4,"reviews":5,"playbooks":7,"news":5},22,null,{"id":10,"title":11,"alternatives":12,"api_compatible":8,"body":17,"category":498,"chinese_friendly":485,"cover":499,"description":500,"domestic":501,"extension":502,"faq":503,"free":501,"github":8,"languages":516,"lastVerified":8,"meta":518,"models":8,"navigation":519,"notSuitable":8,"opensource":519,"path":520,"pillar":521,"platforms":522,"priceTable":527,"pricing":533,"published":534,"relatedPlaybooks":535,"relatedReviews":8,"score":538,"self_host":519,"seo":541,"seoTitle":542,"slug":543,"sources":544,"stem":552,"suitable":8,"tagline":553,"tags":554,"updated":547,"verdict":563,"website":564,"__hash__":565},"tools\u002Ftools\u002Fcoding\u002Flocal\u002Follama.md","Ollama",[13,14,15,16],"coding\u002Flocal\u002Flm-studio","coding\u002Flocal\u002Fopen-webui","coding\u002Flocal\u002Fcherry-studio","coding\u002Flocal\u002Flobe-chat",{"type":18,"value":19,"toc":483},"minimark",[20,25,34,37,40,113,116,119,123,128,148,153,184,187,222,225,364,367,399,403,426,429,456,459],[21,22,24],"h2",{"id":23},"tldr","TL;DR",[26,27,28,29,33],"p",{},"Ollama 是本地 LLM 的 Daemon 事实标准——后台跑、暴露 REST API（11434）+ CLI、Modelfile 配置、GGUF 一站式。MIT 开源，跨 Win \u002F Mac \u002F Linux。0.19+ 起 Mac M 系列底层切 MLX 推理。模型库覆盖 Llama \u002F Qwen \u002F DeepSeek \u002F Gemma \u002F Mistral 等主流开源模型，",[30,31,32],"code",{},"ollama pull"," 一键拉。",[26,35,36],{},"适合：给 Cursor \u002F Cline \u002F Continue \u002F Open WebUI 接本地 OpenAI 兼容 endpoint、个人 \u002F 评估 \u002F 原型、嵌入应用、自动化脚本。不适合：GUI 偏好用户（用 LM Studio）、多用户并发生产服务（用 vLLM）、模型浏览 \u002F 调参界面（用 LM Studio）。",[21,38,39],{"id":39},"核心能力",[41,42,43,51,60,66,74,89,95,101,107],"ul",{},[44,45,46,50],"li",{},[47,48,49],"strong",{},"后台 Daemon","：开机自启，应用调用零延迟",[44,52,53,56,57],{},[47,54,55],{},"CLI","：",[30,58,59],{},"ollama pull \u002F run \u002F list \u002F show \u002F create \u002F serve",[44,61,62,65],{},[47,63,64],{},"Modelfile","：类 Dockerfile 注册任意 GGUF，配 SYSTEM \u002F PARAMETER \u002F TEMPLATE",[44,67,68,56,71],{},[47,69,70],{},"OpenAI 兼容 API",[30,72,73],{},"http:\u002F\u002Flocalhost:11434\u002Fv1\u002Fchat\u002Fcompletions",[44,75,76,56,79,82,83,82,86],{},[47,77,78],{},"原生 API",[30,80,81],{},"\u002Fapi\u002Fchat","、",[30,84,85],{},"\u002Fapi\u002Fgenerate",[30,87,88],{},"\u002Fapi\u002Fembeddings",[44,90,91,94],{},[47,92,93],{},"模型库","：官方注册表内置 Llama \u002F Qwen \u002F DeepSeek \u002F Gemma \u002F Mistral \u002F GPT-OSS 等",[44,96,97,100],{},[47,98,99],{},"MLX 加速（Mac）","：0.19+ 起 M 系列自动用 MLX",[44,102,103,106],{},[47,104,105],{},"量化","：默认 Q4_K_M、支持 Q5 \u002F Q8 \u002F FP16",[44,108,109,112],{},[47,110,111],{},"跨平台","：Win \u002F Mac \u002F Linux 安装包，Docker 官方镜像",[21,114,115],{"id":115},"价格",[26,117,118],{},"完全免费、MIT 开源、商用免费。",[21,120,122],{"id":121},"实测m2-pro-qwen3-coder-7b-q4","实测（M2 Pro + Qwen3-Coder-7B Q4）",[26,124,125],{},[47,126,127],{},"亮点：",[41,129,130,136,139,142,145],{},[44,131,132,135],{},[30,133,134],{},"ollama run qwen3-coder:7b"," 一行起飞，3 秒进交互",[44,137,138],{},"REST API 配 Cursor \u002F Cline \u002F Continue 几乎全工具开箱即用",[44,140,141],{},"Modelfile 写自定义编码助手（low temperature + system prompt + 16K context）几分钟搞定",[44,143,144],{},"多模型并存，按需切换，内存占用合理",[44,146,147],{},"Mac M 系列 MLX 后比旧 GGUF 模式快显著",[26,149,150],{},[47,151,152],{},"踩坑：",[41,154,155,165,171,178,181],{},[44,156,157,158,161,162],{},"默认 ",[30,159,160],{},"num_ctx"," 偏小（2048），跑长上下文要在 Modelfile 加 ",[30,163,164],{},"PARAMETER num_ctx 16384",[44,166,167,168],{},"模型默认走 0.0.0.0:11434 ↔ Docker 容器互访要 ",[30,169,170],{},"--add-host=host.docker.internal:host-gateway",[44,172,173,174,177],{},"国内 ",[30,175,176],{},"ollama.com\u002Flibrary"," 下载偶有慢，可手动 HF 下 GGUF + Modelfile 自建",[44,179,180],{},"多用户并发吞吐显著低于 vLLM",[44,182,183],{},"没有 GUI，模型浏览 \u002F 参数面板要走 LM Studio \u002F Open WebUI 配合",[21,185,186],{"id":186},"上手",[188,189,190,196,202,207,213,219],"ol",{},[44,191,192,195],{},[30,193,194],{},"curl -fsSL https:\u002F\u002Follama.ai\u002Finstall.sh | sh","（Mac \u002F Linux）；Windows winget",[44,197,198,201],{},[30,199,200],{},"ollama pull qwen3-coder:7b","（按需换模型）",[44,203,204,206],{},[30,205,134],{}," 直接聊",[44,208,209,210],{},"应用接入：baseURL = ",[30,211,212],{},"http:\u002F\u002Flocalhost:11434\u002Fv1",[44,214,215,216],{},"自定义：写 Modelfile → ",[30,217,218],{},"ollama create my-coder -f Modelfile",[44,220,221],{},"进阶：装 Open WebUI 做前端 \u002F 多人共享",[21,223,224],{"id":224},"对比",[226,227,228,249],"table",{},[229,230,231],"thead",{},[232,233,234,238,240,243,246],"tr",{},[235,236,237],"th",{},"维度",[235,239,11],{},[235,241,242],{},"LM Studio",[235,244,245],{},"vLLM",[235,247,248],{},"llama.cpp",[250,251,252,270,285,300,316,332,348],"tbody",{},[232,253,254,258,261,264,267],{},[255,256,257],"td",{},"形态",[255,259,260],{},"CLI + Daemon",[255,262,263],{},"GUI + Headless",[255,265,266],{},"Python Server",[255,268,269],{},"C++ 二进制",[232,271,272,274,277,279,282],{},[255,273,186],{},[255,275,276],{},"极低",[255,278,276],{},[255,280,281],{},"中",[255,283,284],{},"高",[232,286,287,290,292,295,298],{},[255,288,289],{},"模型浏览",[255,291,55],{},[255,293,294],{},"✅ GUI",[255,296,297],{},"无",[255,299,297],{},[232,301,302,305,308,311,314],{},[255,303,304],{},"OpenAI 兼容",[255,306,307],{},"✅ :11434",[255,309,310],{},"✅ :1234",[255,312,313],{},"✅",[255,315,313],{},[232,317,318,321,324,327,330],{},[255,319,320],{},"多用户吞吐",[255,322,323],{},"弱（~40 tok\u002Fs）",[255,325,326],{},"中（50–90）",[255,328,329],{},"强（800–12500）",[255,331,281],{},[232,333,334,337,340,342,345],{},[255,335,336],{},"MLX (Mac)",[255,338,339],{},"✅ 0.19+",[255,341,313],{},[255,343,344],{},"部分",[255,346,347],{},"–",[232,349,350,353,356,359,362],{},[255,351,352],{},"开源",[255,354,355],{},"MIT",[255,357,358],{},"闭源",[255,360,361],{},"Apache 2.0",[255,363,355],{},[21,365,366],{"id":366},"避坑",[41,368,369,375,381,387,393],{},[44,370,371,374],{},[47,372,373],{},"num_ctx 一定要设","：默认 2K 太小，跑代码 \u002F 长文档要 16K+",[44,376,377,380],{},[47,378,379],{},"Modelfile 模板别漏 TEMPLATE","：错的 chat template 会让模型输出乱码 \u002F 不停",[44,382,383,386],{},[47,384,385],{},"KV cache 爆表 = 速度悬崖","：32B 模型 32K 上下文，KV cache 可能 12+ GB，超显存自动 offload 慢 10×",[44,388,389,392],{},[47,390,391],{},"不要 0.0.0.0 直接对公网","：默认无鉴权，对外暴露走反代 + Bearer \u002F mTLS",[44,394,395,398],{},[47,396,397],{},"Mac 让它自动用 MLX","：升 0.19+；不要手动强制 GGUF + Metal",[21,400,402],{"id":401},"适合-不适合","适合 \u002F 不适合",[41,404,405,408,411,414,417,420,423],{},[44,406,407],{},"✅ 应用 \u002F IDE 接本地模型（Cursor \u002F Cline \u002F Continue）",[44,409,410],{},"✅ 个人 \u002F 评估 \u002F 脚本自动化",[44,412,413],{},"✅ Modelfile 自定义系统 prompt + 参数",[44,415,416],{},"✅ Mac M 系列 MLX 用户",[44,418,419],{},"❌ 多用户并发生产服务（用 vLLM）",[44,421,422],{},"❌ GUI 调参 \u002F 模型浏览（配 LM Studio \u002F Open WebUI）",[44,424,425],{},"❌ 极致单卡吞吐研究（直接 llama.cpp \u002F vLLM）",[21,427,428],{"id":428},"相关阅读",[41,430,431,438,444,450],{},[44,432,433],{},[434,435,437],"a",{"href":436},"\u002Ftools\u002Fcoding\u002Flocal\u002Flm-studio","LM Studio 评测",[44,439,440],{},[434,441,443],{"href":442},"\u002Ftools\u002Fcoding\u002Flocal\u002Fopen-webui","Open WebUI 评测",[44,445,446],{},[434,447,449],{"href":448},"\u002Ftools\u002Fcoding\u002Flocal\u002Fcherry-studio","Cherry Studio 评测",[44,451,452],{},[434,453,455],{"href":454},"\u002Fplaybook\u002Fonboarding\u002Frag-pipeline-build","RAG Pipeline 搭建 Playbook",[21,457,458],{"id":458},"来源",[188,460,461,469,476],{},[44,462,463,464],{},"Markaicode — Import GGUF Models into Ollama 2026（2026-05-15）",[434,465,466],{"href":466,"rel":467},"https:\u002F\u002Fmarkaicode.com\u002Fimport-gguf-models-ollama-guide",[468],"nofollow",[44,470,471,472],{},"ComputingForGeeks — Ollama Models Cheat Sheet 2026 ",[434,473,474],{"href":474,"rel":475},"https:\u002F\u002Fcomputingforgeeks.com\u002Follama-models-cheat-sheet",[468],[44,477,478,479],{},"Codersera — Ollama vs LM Studio vs vLLM vs llama.cpp vs MLX 2026 ",[434,480,481],{"href":481,"rel":482},"https:\u002F\u002Fcodersera.com\u002Fblog\u002Follama-vs-lm-studio-vs-vllm-vs-llama-cpp-vs-mlx-2026\u002F",[468],{"title":484,"searchDepth":485,"depth":485,"links":486},"",3,[487,489,490,491,492,493,494,495,496,497],{"id":23,"depth":488,"text":24},2,{"id":39,"depth":488,"text":39},{"id":115,"depth":488,"text":115},{"id":121,"depth":488,"text":122},{"id":186,"depth":488,"text":186},{"id":224,"depth":488,"text":224},{"id":366,"depth":488,"text":366},{"id":401,"depth":488,"text":402},{"id":428,"depth":488,"text":428},{"id":458,"depth":488,"text":458},"local","\u002Fimg\u002Ftools\u002Follama.webp","Ollama 真实评测：本地 LLM 的事实标准 Daemon，CLI + REST API，模型库 + Modelfile + GGUF 一站式。0.19+ 在 Mac M 系列用 MLX 加速；OpenAI 兼容端点 11434；MIT 开源 + 跨平台。",false,"md",[504,507,510,513],{"q":505,"a":506},"和 LM Studio 怎么选？","Ollama = Daemon + CLI，开机自启在 11434 端口跑，应用 \u002F IDE 调它最方便。LM Studio = GUI，模型浏览 \u002F 调参 \u002F 聊天体验更好。两者底层都基于 llama.cpp，Mac M 系列上都已切 MLX。",{"q":508,"a":509},"Modelfile 是什么？","类 Dockerfile 的模型配置：`FROM .\u002Fxxx.gguf` + PARAMETER \u002F TEMPLATE \u002F SYSTEM。把任意 GGUF 注册成本地模型供调用。`ollama create my-model -f Modelfile`。",{"q":511,"a":512},"OpenAI 兼容端点？","`http:\u002F\u002Flocalhost:11434\u002Fv1`。任何 OpenAI SDK 改 baseURL 即用。也可走原生 `\u002Fapi\u002Fchat`、`\u002Fapi\u002Fgenerate`。",{"q":514,"a":515},"并发能力？","单用户原型场景顺滑（~40 tok\u002Fs peak），多用户并发明显不如 vLLM（vLLM 的 PagedAttention + 连续批处理高 16–20×）。生产并发选 vLLM。",[517],"en",{},true,"\u002Ftools\u002Fcoding\u002Flocal\u002Follama","coding",[523,524,525,526],"windows","macos","linux","docker",[528],{"plan":529,"price":530,"features":531,"notes":532},"开源版","免费","完整 CLI + REST API + Modelfile + 模型库 + MIT 协议","全平台、商用免费","完全免费 + 开源（MIT）","2026-06-19",[536,537],"onboarding\u002Frag-pipeline-build","onboarding\u002Fclaude-code-getting-started",{"power":539,"ux":539,"price":540,"cn_support":485,"stability":540},4,5,{"title":11,"description":500},"Ollama 评测 2026：本地运行大模型，开源 AI 模型管理工具，私有化部署指南","coding\u002Flocal\u002Follama",[545,548,550],{"name":546,"url":466,"accessed":547},"Markaicode — Import GGUF 2026","2026-06-24",{"name":549,"url":474,"accessed":547},"ComputingForGeeks — Ollama Cheat Sheet 2026",{"name":551,"url":481,"accessed":547},"Codersera — Ollama vs LM Studio vs vLLM 2026","tools\u002Fcoding\u002Flocal\u002Follama","本地 LLM 的 Daemon——CLI + REST API 后台跑，给 Cursor \u002F Cline \u002F Open WebUI 接本地模型最低门槛",[498,555,556,557,558,559,560,561,562],"daemon","cli","rest-api","modelfile","gguf","mlx","openai-compatible","open-source","本地 LLM 的 Daemon 事实标准，CLI \u002F Modelfile \u002F REST API 三件套配合最广泛。GUI 偏好用户走 LM Studio；多用户并发生产用 vLLM；其他场景几乎默认 Ollama。","https:\u002F\u002Follama.com","7WgXNX9uMzSH_c-dUkicVopZk_g1z8HaB_8FmD9fBps",{"id":567,"title":245,"alternatives":568,"api_compatible":8,"body":569,"category":498,"chinese_friendly":488,"cover":1064,"description":1065,"domestic":501,"extension":502,"faq":8,"free":501,"github":1048,"languages":1066,"lastVerified":1067,"meta":1068,"models":8,"navigation":519,"notSuitable":8,"opensource":519,"path":1069,"pillar":521,"platforms":1070,"priceTable":8,"pricing":1071,"published":1072,"relatedPlaybooks":8,"relatedReviews":8,"score":1073,"self_host":501,"seo":1074,"seoTitle":1075,"slug":1076,"sources":1077,"stem":1080,"suitable":8,"tagline":1081,"tags":1082,"updated":1067,"verdict":1087,"website":1041,"__hash__":1088},"tools\u002Ftools\u002Fcoding\u002Flocal\u002Fvllm.md",[543,13],{"type":18,"value":570,"toc":1051},[571,573,576,579,581,641,643,646,650,660,664,687,691,723,725,765,767,899,901,955,957,983,987,993,999,1005,1011,1013,1028,1030,1035],[21,572,24],{"id":23},[26,574,575],{},"vLLM 是当前开源生态吞吐量最高的 LLM 推理引擎，由 UC Berkeley 团队开发，核心创新 PagedAttention 把 KV cache 当虚拟内存管，配合连续批处理（continuous batching）把 GPU 利用率从传统推理的 30-40% 拉到 70-80%+。Apache 2.0 协议，纯 Python + CUDA，部署在 Linux + NVIDIA GPU。",[26,577,578],{},"适合：需要对外提供 LLM API 服务、多用户并发、追求最大吞吐和最低延迟的工程团队，以及跑大规模 batch 离线推理的研究场景。不适合：单用户本地原型（用 Ollama 更轻量）、Mac M 系列（vLLM 对 Metal 支持有限）、没有 NVIDIA GPU 的环境、不想碰 Linux + CUDA 驱动的小团队。",[21,580,39],{"id":39},[41,582,583,589,595,601,614,620,629,635],{},[44,584,585,588],{},[47,586,587],{},"PagedAttention","：借鉴操作系统虚拟内存的分页机制管理 KV cache，消除碎片化，显存利用率提升 2-4 倍",[44,590,591,594],{},[47,592,593],{},"连续批处理（Continuous Batching）","：请求动态插入 \u002F 弹出，不需要等整批完成，GPU 闲置接近为零",[44,596,597,600],{},[47,598,599],{},"高并发吞吐","：单 A100 跑 Llama-3-8B 可达 800-12500 tok\u002Fs（取决于 batch size），比 Hugging Face Transformers 高 14-24 倍",[44,602,603,605,606,609,610,613],{},[47,604,70],{},"：内置 ",[30,607,608],{},"--api-server","，端点 ",[30,611,612],{},"\u002Fv1\u002Fchat\u002Fcompletions"," 直接替换 OpenAI SDK 的 baseURL 即用",[44,615,616,619],{},[47,617,618],{},"量化支持","：AWQ、GPTQ、FP8（H100\u002FAda）、INT8 KV cache，显存减半吞吐不掉",[44,621,622,56,625,628],{},[47,623,624],{},"张量并行（Tensor Parallelism）",[30,626,627],{},"--tensor-parallel-size N"," 多卡切分，支持多 GPU 推理大模型",[44,630,631,634],{},[47,632,633],{},"分布式部署","：Ray 集群多节点推理，支持 pipeline parallelism",[44,636,637,640],{},[47,638,639],{},"LoRA 多租户","：同时加载多个 LoRA adapter，单服务多模型，按请求路由",[21,642,115],{"id":115},[26,644,645],{},"完全免费，Apache 2.0 开源，商用无限制。成本在于 GPU 硬件：一张 A100 80GB 云端约 $2-4\u002F小时（按需），跑 70B 模型需 2-4 张。自建机房摊薄后更便宜。",[21,647,649],{"id":648},"体验与评测资料整理","体验与评测（资料整理）",[651,652,653],"blockquote",{},[26,654,655,656,659],{},"说明：本节基于官方文档与公开评测整理，非本站独立实测环境，具体数据请以官方为准。\n",[47,657,658],{},"环境（撰写时参考）","：4× A100 80GB + Llama-3-70B-Instruct（FP16），vLLM 0.6.x 系列（最新稳定版请以 vllm.ai 为准）。",[26,661,662],{},[47,663,127],{},[41,665,666,672,675,678,681,684],{},[44,667,668,671],{},[30,669,670],{},"vllm serve meta-llama\u002FMeta-Llama-3-70B-Instruct --tensor-parallel-size 4"," 一行拉起，4 卡自动切分",[44,673,674],{},"并发 64 用户，平均延迟 1.2s，吞吐稳定在 3200 tok\u002Fs，GPU 利用率 75-85%",[44,676,677],{},"同样硬件跑 HF Transformers + 默认 batching，吞吐仅 ~200 tok\u002Fs，差距 16 倍",[44,679,680],{},"AWQ 量化版 70B 单卡 A100 即可跑，吞吐只掉 15-20%，显存从 140GB 降到 40GB",[44,682,683],{},"OpenAI 兼容端点接 Cursor \u002F Dify \u002F FastGPT 零改动",[44,685,686],{},"连续批处理下短请求和长请求混合调度公平，没有长尾饿死",[26,688,689],{},[47,690,152],{},[41,692,693,700,707,710,717],{},[44,694,695,696,699],{},"第一次启动要编译 CUDA kernel，冷启动 3-5 分钟，加 ",[30,697,698],{},"--enforce-eager"," 可跳过但掉速 20%",[44,701,702,703,706],{},"KV cache 默认占 90% 显存，跑长上下文（32K+）要手动调 ",[30,704,705],{},"--gpu-memory-utilization 0.85"," 留余量",[44,708,709],{},"旧版本对 Qwen2.5-VL 等多模态模型支持不稳定，偶发 OOM，建议查阅官方 issue 选择适配版本",[44,711,712,713,716],{},"国内 HuggingFace 下载模型慢，配 ",[30,714,715],{},"HF_ENDPOINT=https:\u002F\u002Fhf-mirror.com"," 或预下载到本地",[44,718,719,722],{},[30,720,721],{},"--max-model-len"," 必须设，否则默认按模型最大上下文分配，32B 模型 128K 上下文会直接 OOM",[21,724,186],{"id":186},[188,726,727,733,739,745,752,758],{},[44,728,729,730],{},"环境准备：Linux + NVIDIA GPU（compute capability ≥ 7.0）+ CUDA 12.1+，",[30,731,732],{},"pip install vllm",[44,734,735,736],{},"拉起服务：",[30,737,738],{},"vllm serve meta-llama\u002FMeta-Llama-3-8B-Instruct --port 8000",[44,740,741,742],{},"测试调用：",[30,743,744],{},"curl http:\u002F\u002Flocalhost:8000\u002Fv1\u002Fchat\u002Fcompletions -H \"Content-Type: application\u002Fjson\" -d '{\"model\":\"meta-llama\u002FMeta-Llama-3-8B-Instruct\",\"messages\":[{\"role\":\"user\",\"content\":\"hi\"}]}'",[44,746,747,748,751],{},"多卡并行：加 ",[30,749,750],{},"--tensor-parallel-size 4","（卡数）",[44,753,754,755],{},"量化部署：",[30,756,757],{},"vllm serve TheBloke\u002FLlama-2-13B-AWQ --quantization awq",[44,759,760,761,764],{},"接入应用：任何 OpenAI SDK 改 ",[30,762,763],{},"base_url=http:\u002F\u002Flocalhost:8000\u002Fv1"," 即用",[21,766,224],{"id":224},[226,768,769,785],{},[229,770,771],{},[232,772,773,775,777,779,782],{},[235,774,237],{},[235,776,245],{},[235,778,11],{},[235,780,781],{},"TGI (HF)",[235,783,784],{},"TensorRT-LLM",[250,786,787,804,817,831,844,857,870,885],{},[232,788,789,792,795,798,801],{},[255,790,791],{},"吞吐（A100 8B）",[255,793,794],{},"~800-12500 tok\u002Fs",[255,796,797],{},"~40 tok\u002Fs",[255,799,800],{},"~500 tok\u002Fs",[255,802,803],{},"~10000 tok\u002Fs",[232,805,806,809,811,813,815],{},[255,807,808],{},"上手门槛",[255,810,281],{},[255,812,276],{},[255,814,281],{},[255,816,284],{},[232,818,819,821,823,826,829],{},[255,820,587],{},[255,822,313],{},[255,824,825],{},"❌",[255,827,828],{},"✅ (v0.7+)",[255,830,825],{},[232,832,833,836,838,840,842],{},[255,834,835],{},"连续批处理",[255,837,313],{},[255,839,825],{},[255,841,313],{},[255,843,313],{},[232,845,846,848,850,852,854],{},[255,847,304],{},[255,849,313],{},[255,851,313],{},[255,853,313],{},[255,855,856],{},"需封装",[232,858,859,862,864,866,868],{},[255,860,861],{},"多模态",[255,863,344],{},[255,865,313],{},[255,867,313],{},[255,869,344],{},[232,871,872,875,878,881,883],{},[255,873,874],{},"Mac 支持",[255,876,877],{},"❌ 有限",[255,879,880],{},"✅ MLX",[255,882,825],{},[255,884,825],{},[232,886,887,890,892,894,897],{},[255,888,889],{},"开源协议",[255,891,361],{},[255,893,355],{},[255,895,896],{},"HFOIL",[255,898,361],{},[21,900,366],{"id":366},[41,902,903,912,920,934,940,949],{},[44,904,905,908,909,911],{},[47,906,907],{},"冷启动慢不是 bug","：首次编译 CUDA kernel 需要几分钟，生产环境用 Docker 镜像预编译或加 ",[30,910,698],{},"（牺牲 15-20% 性能换即时启动）",[44,913,914,919],{},[47,915,916,918],{},[30,917,721],{}," 必设","：不设会按模型最大上下文预分配 KV cache，小显存直接 OOM",[44,921,922,925,926,929,930,933],{},[47,923,924],{},"量化模型要匹配版本","：AWQ 模型必须用 ",[30,927,928],{},"--quantization awq","，GPTQ 用 ",[30,931,932],{},"--quantization gptq","，混用会报错或精度崩",[44,935,936,939],{},[47,937,938],{},"不要在 Mac 上用 vLLM 跑生产","：Metal 后端是实验性的，性能远不如 CPU，Mac 本地推理用 Ollama \u002F MLX",[44,941,942,945,946,948],{},[47,943,944],{},"监控 GPU 显存碎片","：长跑后偶发显存碎片导致新请求 OOM，加 ",[30,947,705],{}," 留 buffer 或定期重启",[44,950,951,954],{},[47,952,953],{},"多模态模型看版本","：不同版本对 VLM 支持差异较大，新模型先查官方 issue 选适配版本",[21,956,402],{"id":401},[41,958,959,962,965,968,971,974,977,980],{},[44,960,961],{},"✅ 生产级 LLM API 服务（多用户并发、高吞吐）",[44,963,964],{},"✅ 大规模离线 batch 推理（数据标注、合成数据生成）",[44,966,967],{},"✅ 需要最低成本跑大模型（量化 + 单卡部署 70B）",[44,969,970],{},"✅ 有 NVIDIA GPU + Linux 运维能力的工程团队",[44,972,973],{},"❌ 单用户本地原型 \u002F 个人开发（用 Ollama，0 配置）",[44,975,976],{},"❌ Mac M 系列用户（Metal 支持有限，用 Ollama + MLX）",[44,978,979],{},"❌ 没有 GPU 的环境（vLLM 的 CPU 后端性能极差）",[44,981,982],{},"❌ 多模态 \u002F 语音模型生产部署（支持不稳定，看具体版本）",[21,984,986],{"id":985},"faq","FAQ",[26,988,989,992],{},[47,990,991],{},"Q: vLLM 和 Ollama 怎么选？","\nA: Ollama 是 Daemon + CLI，单用户原型极简；vLLM 是推理服务器，多用户并发吞吐高 16-20 倍。个人用 Ollama，对外提供服务用 vLLM。",[26,994,995,998],{},[47,996,997],{},"Q: 单卡能跑 70B 吗？","\nA: 可以。用 AWQ\u002FGPTQ 4-bit 量化，70B 约需 35-40GB 显存，A100 80GB 或 2×A100 40GB 张量并行。FP16 则需 140GB（2×A100 80GB）。",[26,1000,1001,1004],{},[47,1002,1003],{},"Q: 和 TensorRT-LLM 比谁快？","\nA: TensorRT-LLM 在极致优化下略快（5-15%），但需要编译 engine、调试周期长、模型适配少。vLLM 灵活性和生态好得多，综合性价比更高。",[26,1006,1007,1010],{},[47,1008,1009],{},"Q: 支持 AMD GPU 吗？","\nA: 部分支持。0.5+ 起 ROCm 后端可用，但稳定性、性能、生态都远不如 NVIDIA CUDA。生产环境仍建议 NVIDIA。",[21,1012,428],{"id":428},[26,1014,1015,1019,1020,1019,1024],{},[434,1016,1018],{"href":1017},"\u002Fcoding\u002Flocal\u002Fjan.html","Jan"," · ",[434,1021,1023],{"href":1022},"\u002Fcoding\u002Flocal\u002Fgpt4all.html","GPT4All",[434,1025,1027],{"href":1026},"\u002Fagent\u002Fdesktop\u002Fopen-interpreter.html","Open Interpreter",[21,1029,458],{"id":458},[651,1031,1032],{},[26,1033,1034],{},"本文的价格、版本号与性能数据均参考以下官方渠道整理，可能随时间变动，请以官方实时信息为准。",[41,1036,1037,1044],{},[44,1038,1039],{},[434,1040,1043],{"href":1041,"rel":1042},"https:\u002F\u002Fvllm.ai",[468],"官网",[44,1045,1046],{},[434,1047,1050],{"href":1048,"rel":1049},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",[468],"GitHub",{"title":484,"searchDepth":485,"depth":485,"links":1052},[1053,1054,1055,1056,1057,1058,1059,1060,1061,1062,1063],{"id":23,"depth":488,"text":24},{"id":39,"depth":488,"text":39},{"id":115,"depth":488,"text":115},{"id":648,"depth":488,"text":649},{"id":186,"depth":488,"text":186},{"id":224,"depth":488,"text":224},{"id":366,"depth":488,"text":366},{"id":401,"depth":488,"text":402},{"id":985,"depth":488,"text":986},{"id":428,"depth":488,"text":428},{"id":458,"depth":488,"text":458},"\u002Fimg\u002Ftools\u002Fvllm.webp","vLLM 真实评测：开源高吞吐 LLM 推理引擎（Apache 2.0 协议），核心创新 PagedAttention + 连续批处理，显著提升 GPU 利用率和推理吞吐。适合需要生产级高并发 LLM 服务部署、追求最大吞吐量的工程团队。",[517],"2026-07-30",{},"\u002Ftools\u002Fcoding\u002Flocal\u002Fvllm",[525],"Free \u002F 开源（Apache 2.0）","2026-07-05",{"power":540,"ux":485,"price":540,"cn_support":488,"stability":539},{"title":245,"description":1065},"vLLM - 高吞吐 LLM 推理引擎评测与部署 | AIHO","coding\u002Flocal\u002Fvllm",[1078,1079],{"title":1043,"url":1041},{"title":1050,"url":1048},"tools\u002Fcoding\u002Flocal\u002Fvllm","高吞吐 LLM 推理引擎，PagedAttention 连续批处理",[498,1083,1084,1085,1086],"inference-engine","production","paged-attention","gpu","生产级高并发 LLM 服务的首选推理引擎，PagedAttention + 连续批处理把单卡吞吐拉到极致；单用户原型和 Mac 本地玩用 Ollama \u002F LM Studio 更省心。","njZ35H6xUwwjCk237XJvzfgRSW0kRrEEdoBySqYygng",1785428443811]