[{"data":1,"prerenderedAt":1085},["ShallowReactive",2],{"header-counts":3,"footer-counts":6,"compare-lm-studio-vs-vllm":8,"compare-a-lm-studio":9,"compare-b-vllm":561},{"tools":4,"reviews":5},98,27,{"tools":4,"reviews":5,"playbooks":7,"news":5},22,null,{"id":10,"title":11,"alternatives":12,"api_compatible":8,"body":17,"category":492,"chinese_friendly":479,"cover":493,"description":494,"domestic":495,"extension":496,"faq":497,"free":495,"github":8,"languages":510,"lastVerified":8,"meta":513,"models":8,"navigation":514,"notSuitable":8,"opensource":495,"path":515,"pillar":516,"platforms":517,"priceTable":521,"pricing":530,"published":531,"relatedPlaybooks":532,"relatedReviews":8,"score":535,"self_host":514,"seo":538,"seoTitle":539,"slug":540,"sources":541,"stem":549,"suitable":8,"tagline":550,"tags":551,"updated":544,"verdict":558,"website":559,"__hash__":560},"tools\u002Ftools\u002Fcoding\u002Flocal\u002Flm-studio.md","LM Studio",[13,14,15,16],"coding\u002Flocal\u002Follama","coding\u002Flocal\u002Fopen-webui","coding\u002Flocal\u002Fcherry-studio","coding\u002Flocal\u002Flobe-chat",{"type":18,"value":19,"toc":477},"minimark",[20,25,34,37,40,100,103,117,123,127,132,149,154,171,174,201,204,358,361,393,397,420,423,450,453],[21,22,24],"h2",{"id":23},"tldr","TL;DR",[26,27,28,29,33],"p",{},"LM Studio 是 Windows \u002F macOS \u002F Linux 桌面应用，让你像浏览 App Store 一样发现、下载、运行本地大模型（GGUF \u002F MLX 格式）。底层基于 llama.cpp + MLX，Mac M 系列原生优化。0.3+ 起新增 Headless 模式 + ",[30,31,32],"code",{},"lms"," CLI，可在服务器跑 OpenAI 兼容 API（默认 :1234）。个人 \u002F 评估完全免费，商用咨询。",[26,35,36],{},"适合：本地 LLM 入门 \u002F 评估、Mac 用户、需要 GUI 调参 \u002F 模型比较、想给 IDE \u002F 应用接本地 OpenAI 兼容 endpoint 的开发者。不适合：多用户并发生产服务（用 vLLM）、嵌入式 \u002F 边缘部署（用 llama.cpp）、纯 CLI 工作流（用 Ollama）。",[21,38,39],{"id":39},"核心能力",[41,42,43,51,57,63,73,82,88,94],"ul",{},[44,45,46,50],"li",{},[47,48,49],"strong",{},"模型浏览器","：内置 Hugging Face 检索，按 GGUF \u002F MLX \u002F 大小筛选、一键下载",[44,52,53,56],{},[47,54,55],{},"聊天界面","：System Prompt \u002F temperature \u002F top-p \u002F context size 可视化调参",[44,58,59,62],{},[47,60,61],{},"多模型并存 \u002F 切换","：同时加载多模型在不同会话中比较",[44,64,65,68,69,72],{},[47,66,67],{},"OpenAI 兼容 Local Server","：",[30,70,71],{},"http:\u002F\u002Flocalhost:1234\u002Fv1","，任何 SDK 即接即用",[44,74,75,68,78,81],{},[47,76,77],{},"Headless \u002F CLI",[30,79,80],{},"lms server start --port 1234","，无 GUI 可跑",[44,83,84,87],{},[47,85,86],{},"PDF \u002F 文档对话","：内置基础 RAG，丢文件就能聊",[44,89,90,93],{},[47,91,92],{},"MLX 原生支持（Mac）","：M1+ 上比 GGUF + Metal 快 30–50%",[44,95,96,99],{},[47,97,98],{},"持续批处理","：Codersera 2026 测得 50–90 tok\u002Fs（消费级 GPU + 中等模型）",[21,101,102],{"id":102},"价格",[41,104,105,111],{},[44,106,107,110],{},[47,108,109],{},"个人 \u002F 评估","：免费，全功能可用",[44,112,113,116],{},[47,114,115],{},"商用","：邮件 \u002F 官网联系 LM Studio 团队",[118,119,120],"blockquote",{},[26,121,122],{},"模型本身免费（开源权重），LM Studio 不抽水任何 token 费用。",[21,124,126],{"id":125},"实测mac-m2-pro-qwen3-coder-7b-gguf-q4_k_m","实测（Mac M2 Pro + Qwen3-Coder-7B GGUF Q4_K_M）",[26,128,129],{},[47,130,131],{},"亮点：",[41,133,134,137,140,143,146],{},[44,135,136],{},"模型浏览器极舒服：搜「qwen3-coder」直接列出 GGUF + MLX 各 quant，标硬件兼容度",[44,138,139],{},"加载 7B Q4 模型 \u003C 3 秒，生成 ~75 tok\u002Fs",[44,141,142],{},"Local Server 开了 Cursor 直接接 baseURL → 本地代码补全零成本",[44,144,145],{},"MLX 版同模型 ~110 tok\u002Fs，差距显著",[44,147,148],{},"多窗口加载 2 个模型并排测，调 prompt 直观",[26,150,151],{},[47,152,153],{},"踩坑：",[41,155,156,159,162,165,168],{},[44,157,158],{},"模型库依赖 Hugging Face，国内访问要镜像 \u002F 代理",[44,160,161],{},"GPU 显存吃满后会自动 offload 到 CPU，无提示就慢下来",[44,163,164],{},"Headless 模式相对 Ollama 偏新，文档稍少",[44,166,167],{},"闭源应用（虽免费），不适合企业合规挂钩",[44,169,170],{},"中文 UI 可用但部分菜单仍英文",[21,172,173],{"id":173},"上手",[175,176,177,180,183,186,189,196],"ol",{},[44,178,179],{},"lmstudio.ai 下载（Mac \u002F Windows \u002F Linux）",[44,181,182],{},"打开 → Discover 标签 → 搜模型（如 qwen3-coder、deepseek-v3 GGUF\u002FMLX）→ Download",[44,184,185],{},"Chat 标签 → 选模型 → 调参聊天",[44,187,188],{},"Local Server 标签 → Start Server → 默认端口 1234",[44,190,191,192,195],{},"在你的应用里：",[30,193,194],{},"baseURL = \"http:\u002F\u002Flocalhost:1234\u002Fv1\"","，API Key 任意",[44,197,198,199],{},"Headless：",[30,200,80],{},[21,202,203],{"id":203},"对比",[205,206,207,228],"table",{},[208,209,210],"thead",{},[211,212,213,217,219,222,225],"tr",{},[214,215,216],"th",{},"维度",[214,218,11],{},[214,220,221],{},"Ollama",[214,223,224],{},"Open WebUI",[214,226,227],{},"llama.cpp",[229,230,231,249,266,282,297,312,327,342],"tbody",{},[211,232,233,237,240,243,246],{},[234,235,236],"td",{},"形态",[234,238,239],{},"GUI + CLI",[234,241,242],{},"CLI Daemon",[234,244,245],{},"Docker UI",[234,247,248],{},"二进制",[211,250,251,254,257,260,263],{},[234,252,253],{},"模型浏览",[234,255,256],{},"✅ 内置",[234,258,259],{},"CLI pull",[234,261,262],{},"无",[234,264,265],{},"手动",[211,267,268,271,274,277,280],{},[234,269,270],{},"参数调优 GUI",[234,272,273],{},"✅",[234,275,276],{},"❌",[234,278,279],{},"部分",[234,281,276],{},[211,283,284,287,290,293,295],{},[234,285,286],{},"OpenAI 兼容 API",[234,288,289],{},"✅ :1234",[234,291,292],{},"✅ :11434",[234,294,273],{},[234,296,273],{},[211,298,299,302,304,307,310],{},[234,300,301],{},"MLX (Mac)",[234,303,273],{},[234,305,306],{},"✅ 0.19+",[234,308,309],{},"–",[234,311,309],{},[211,313,314,317,320,322,324],{},[234,315,316],{},"多用户并发",[234,318,319],{},"弱",[234,321,319],{},[234,323,273],{},[234,325,326],{},"中",[211,328,329,332,335,338,340],{},[234,330,331],{},"开源",[234,333,334],{},"闭源（免费）",[234,336,337],{},"MIT",[234,339,337],{},[234,341,337],{},[211,343,344,347,350,353,355],{},[234,345,346],{},"上手难度",[234,348,349],{},"极低",[234,351,352],{},"低",[234,354,326],{},[234,356,357],{},"高",[21,359,360],{"id":360},"避坑",[41,362,363,369,375,381,387],{},[44,364,365,368],{},[47,366,367],{},"国内下模型走镜像","：HF 直连慢 \u002F 卡，配 HF_ENDPOINT=hf-mirror.com",[44,370,371,374],{},[47,372,373],{},"显存爆 ≠ 报错","：GPU 装不下会无声 offload 到 CPU，关注生成速度，必要时降 quant 或换小模型",[44,376,377,380],{},[47,378,379],{},"MLX 优先（Mac M 系列）","：能下 MLX 版就别下 GGUF，速度差距明显",[44,382,383,386],{},[47,384,385],{},"Local Server 暴露要谨慎","：默认 0.0.0.0 + 无鉴权，对外开放前加反代 + Bearer",[44,388,389,392],{},[47,390,391],{},"闭源合规要核","：企业内部使用前查 license；商用必须联系官方",[21,394,396],{"id":395},"适合-不适合","适合 \u002F 不适合",[41,398,399,402,405,408,411,414,417],{},[44,400,401],{},"✅ 本地 LLM 入门 \u002F 评估",[44,403,404],{},"✅ Mac M 系列用户",[44,406,407],{},"✅ 想给 Cursor \u002F Cline 接本地 OpenAI 兼容 endpoint",[44,409,410],{},"✅ 需要 GUI 调参 \u002F 模型比较",[44,412,413],{},"❌ 多用户并发生产服务",[44,415,416],{},"❌ 嵌入式 \u002F 边缘设备",[44,418,419],{},"❌ 强合规 \u002F 必须开源审计",[21,421,422],{"id":422},"相关阅读",[41,424,425,432,438,444],{},[44,426,427],{},[428,429,431],"a",{"href":430},"\u002Ftools\u002Fcoding\u002Flocal\u002Follama","Ollama 评测",[44,433,434],{},[428,435,437],{"href":436},"\u002Ftools\u002Fcoding\u002Flocal\u002Fopen-webui","Open WebUI 评测",[44,439,440],{},[428,441,443],{"href":442},"\u002Ftools\u002Fcoding\u002Flocal\u002Fcherry-studio","Cherry Studio 评测",[44,445,446],{},[428,447,449],{"href":448},"\u002Fplaybook\u002Fonboarding\u002Fclaude-code-getting-started","Claude Code 上手 Playbook",[21,451,452],{"id":452},"来源",[175,454,455,463,470],{},[44,456,457,458],{},"LM Studio 官网 ",[428,459,460],{"href":460,"rel":461},"https:\u002F\u002Flmstudio.ai\u002F",[462],"nofollow",[44,464,465,466],{},"Codersera — LM Studio Complete Guide 2026 ",[428,467,468],{"href":468,"rel":469},"https:\u002F\u002Fcodersera.com\u002Fblog\u002Flm-studio-complete-guide-2026\u002F",[462],[44,471,472,473],{},"Codersera — Ollama vs LM Studio vs vLLM vs llama.cpp vs MLX 2026 ",[428,474,475],{"href":475,"rel":476},"https:\u002F\u002Fcodersera.com\u002Fblog\u002Follama-vs-lm-studio-vs-vllm-vs-llama-cpp-vs-mlx-2026\u002F",[462],{"title":478,"searchDepth":479,"depth":479,"links":480},"",3,[481,483,484,485,486,487,488,489,490,491],{"id":23,"depth":482,"text":24},2,{"id":39,"depth":482,"text":39},{"id":102,"depth":482,"text":102},{"id":125,"depth":482,"text":126},{"id":173,"depth":482,"text":173},{"id":203,"depth":482,"text":203},{"id":360,"depth":482,"text":360},{"id":395,"depth":482,"text":396},{"id":422,"depth":482,"text":422},{"id":452,"depth":482,"text":452},"local","\u002Fimg\u002Ftools\u002Flm-studio.webp","LM Studio 真实评测：跨平台桌面应用，运行本地 GGUF \u002F MLX 大模型。50–90 tok\u002Fs 持续批处理、OpenAI 兼容本地 API（默认端口 1234）、Headless 模式、Mac \u002F Win 双端。对个人开发者免费，企业咨询。",false,"md",[498,501,504,507],{"q":499,"a":500},"和 Ollama 怎么选？","LM Studio 是 GUI 优先（模型浏览器 + 参数面板 + 聊天界面），适合个人 \u002F 评估 \u002F 上手。Ollama 是 CLI \u002F Daemon 优先（后台跑 + REST API），适合应用嵌入 \u002F 脚本调用。两者都基于 llama.cpp，在 Mac M 系列上都已用 MLX。",{"q":502,"a":503},"支持 MLX 吗？","支持。Mac M1+ 上可加载 MLX 格式模型，速度比 GGUF + Metal 快 30–50%。模型搜索时筛选 MLX 即可。",{"q":505,"a":506},"OpenAI 兼容 API 怎么用？","开 Local Server → 默认端口 1234 → `http:\u002F\u002Flocalhost:1234\u002Fv1`。任何 OpenAI SDK 把 baseURL 改这个就能跑本地模型，零代码改动。",{"q":508,"a":509},"Headless 模式？","0.3+ 起支持 `lms server start` CLI 启动后台服务，无 GUI 即可跑 OpenAI 兼容 API，适合服务器 \u002F SSH 场景。",[511,512],"en","zh",{},true,"\u002Ftools\u002Fcoding\u002Flocal\u002Flm-studio","coding",[518,519,520],"windows","macos","linux",[522,526],{"plan":109,"price":523,"features":524,"notes":525},"免费","全功能 GUI + Headless API + GGUF\u002FMLX","供个人 \u002F 评估使用",{"plan":115,"price":527,"features":528,"notes":529},"联系咨询","团队部署 \u002F 商用 license","邮件 \u002F 官网联系","免费（个人 \u002F 评估） \u002F 企业 \u002F 商用咨询","2026-06-19",[533,534],"onboarding\u002Frag-pipeline-build","onboarding\u002Fclaude-code-getting-started",{"power":536,"ux":537,"price":537,"cn_support":479,"stability":536},4,5,{"title":11,"description":494},"LM Studio 评测 2026：本地运行开源大模型，图形化界面，AI 模型管理","coding\u002Flocal\u002Flm-studio",[542,545,547],{"name":543,"url":460,"accessed":544},"LM Studio 官网","2026-06-24",{"name":546,"url":468,"accessed":544},"Codersera — LM Studio Complete Guide 2026",{"name":548,"url":475,"accessed":544},"Codersera — Ollama vs LM Studio vs vLLM 2026","tools\u002Fcoding\u002Flocal\u002Flm-studio","本地 LLM 的 GUI 首选——模型浏览器 + GGUF\u002FMLX 推理 + OpenAI 兼容 API + Mac 原生优化",[492,552,553,554,555,556,557],"gui","gguf","mlx","llama-cpp","mac","openai-compatible","Mac \u002F Windows 桌面本地 LLM 的 GUI 首选——上手最快、模型浏览最舒服、自带 OpenAI 兼容 API。批量服务 \u002F 多用户场景用 vLLM；纯 CLI \u002F 嵌入应用走 Ollama。","https:\u002F\u002Flmstudio.ai","LobnLABcHoL2A6Bu-tfBMAlwTLq_jKyEJkNmD662RWU",{"id":562,"title":563,"alternatives":564,"api_compatible":8,"body":565,"category":492,"chinese_friendly":482,"cover":1060,"description":1061,"domestic":495,"extension":496,"faq":8,"free":495,"github":1044,"languages":1062,"lastVerified":1063,"meta":1064,"models":8,"navigation":514,"notSuitable":8,"opensource":514,"path":1065,"pillar":516,"platforms":1066,"priceTable":8,"pricing":1067,"published":1068,"relatedPlaybooks":8,"relatedReviews":8,"score":1069,"self_host":495,"seo":1070,"seoTitle":1071,"slug":1072,"sources":1073,"stem":1076,"suitable":8,"tagline":1077,"tags":1078,"updated":1063,"verdict":1083,"website":1037,"__hash__":1084},"tools\u002Ftools\u002Fcoding\u002Flocal\u002Fvllm.md","vLLM",[13,540],{"type":18,"value":566,"toc":1047},[567,569,572,575,577,637,639,642,646,655,659,682,686,718,720,760,762,895,897,951,953,979,983,989,995,1001,1007,1009,1024,1026,1031],[21,568,24],{"id":23},[26,570,571],{},"vLLM 是当前开源生态吞吐量最高的 LLM 推理引擎，由 UC Berkeley 团队开发，核心创新 PagedAttention 把 KV cache 当虚拟内存管，配合连续批处理（continuous batching）把 GPU 利用率从传统推理的 30-40% 拉到 70-80%+。Apache 2.0 协议，纯 Python + CUDA，部署在 Linux + NVIDIA GPU。",[26,573,574],{},"适合：需要对外提供 LLM API 服务、多用户并发、追求最大吞吐和最低延迟的工程团队，以及跑大规模 batch 离线推理的研究场景。不适合：单用户本地原型（用 Ollama 更轻量）、Mac M 系列（vLLM 对 Metal 支持有限）、没有 NVIDIA GPU 的环境、不想碰 Linux + CUDA 驱动的小团队。",[21,576,39],{"id":39},[41,578,579,585,591,597,610,616,625,631],{},[44,580,581,584],{},[47,582,583],{},"PagedAttention","：借鉴操作系统虚拟内存的分页机制管理 KV cache，消除碎片化，显存利用率提升 2-4 倍",[44,586,587,590],{},[47,588,589],{},"连续批处理（Continuous Batching）","：请求动态插入 \u002F 弹出，不需要等整批完成，GPU 闲置接近为零",[44,592,593,596],{},[47,594,595],{},"高并发吞吐","：单 A100 跑 Llama-3-8B 可达 800-12500 tok\u002Fs（取决于 batch size），比 Hugging Face Transformers 高 14-24 倍",[44,598,599,601,602,605,606,609],{},[47,600,286],{},"：内置 ",[30,603,604],{},"--api-server","，端点 ",[30,607,608],{},"\u002Fv1\u002Fchat\u002Fcompletions"," 直接替换 OpenAI SDK 的 baseURL 即用",[44,611,612,615],{},[47,613,614],{},"量化支持","：AWQ、GPTQ、FP8（H100\u002FAda）、INT8 KV cache，显存减半吞吐不掉",[44,617,618,68,621,624],{},[47,619,620],{},"张量并行（Tensor Parallelism）",[30,622,623],{},"--tensor-parallel-size N"," 多卡切分，支持多 GPU 推理大模型",[44,626,627,630],{},[47,628,629],{},"分布式部署","：Ray 集群多节点推理，支持 pipeline parallelism",[44,632,633,636],{},[47,634,635],{},"LoRA 多租户","：同时加载多个 LoRA adapter，单服务多模型，按请求路由",[21,638,102],{"id":102},[26,640,641],{},"完全免费，Apache 2.0 开源，商用无限制。成本在于 GPU 硬件：一张 A100 80GB 云端约 $2-4\u002F小时（按需），跑 70B 模型需 2-4 张。自建机房摊薄后更便宜。",[21,643,645],{"id":644},"体验与评测资料整理","体验与评测（资料整理）",[118,647,648],{},[26,649,650,651,654],{},"说明：本节基于官方文档与公开评测整理，非本站独立实测环境，具体数据请以官方为准。\n",[47,652,653],{},"环境（撰写时参考）","：4× A100 80GB + Llama-3-70B-Instruct（FP16），vLLM 0.6.x 系列（最新稳定版请以 vllm.ai 为准）。",[26,656,657],{},[47,658,131],{},[41,660,661,667,670,673,676,679],{},[44,662,663,666],{},[30,664,665],{},"vllm serve meta-llama\u002FMeta-Llama-3-70B-Instruct --tensor-parallel-size 4"," 一行拉起，4 卡自动切分",[44,668,669],{},"并发 64 用户，平均延迟 1.2s，吞吐稳定在 3200 tok\u002Fs，GPU 利用率 75-85%",[44,671,672],{},"同样硬件跑 HF Transformers + 默认 batching，吞吐仅 ~200 tok\u002Fs，差距 16 倍",[44,674,675],{},"AWQ 量化版 70B 单卡 A100 即可跑，吞吐只掉 15-20%，显存从 140GB 降到 40GB",[44,677,678],{},"OpenAI 兼容端点接 Cursor \u002F Dify \u002F FastGPT 零改动",[44,680,681],{},"连续批处理下短请求和长请求混合调度公平，没有长尾饿死",[26,683,684],{},[47,685,153],{},[41,687,688,695,702,705,712],{},[44,689,690,691,694],{},"第一次启动要编译 CUDA kernel，冷启动 3-5 分钟，加 ",[30,692,693],{},"--enforce-eager"," 可跳过但掉速 20%",[44,696,697,698,701],{},"KV cache 默认占 90% 显存，跑长上下文（32K+）要手动调 ",[30,699,700],{},"--gpu-memory-utilization 0.85"," 留余量",[44,703,704],{},"旧版本对 Qwen2.5-VL 等多模态模型支持不稳定，偶发 OOM，建议查阅官方 issue 选择适配版本",[44,706,707,708,711],{},"国内 HuggingFace 下载模型慢，配 ",[30,709,710],{},"HF_ENDPOINT=https:\u002F\u002Fhf-mirror.com"," 或预下载到本地",[44,713,714,717],{},[30,715,716],{},"--max-model-len"," 必须设，否则默认按模型最大上下文分配，32B 模型 128K 上下文会直接 OOM",[21,719,173],{"id":173},[175,721,722,728,734,740,747,753],{},[44,723,724,725],{},"环境准备：Linux + NVIDIA GPU（compute capability ≥ 7.0）+ CUDA 12.1+，",[30,726,727],{},"pip install vllm",[44,729,730,731],{},"拉起服务：",[30,732,733],{},"vllm serve meta-llama\u002FMeta-Llama-3-8B-Instruct --port 8000",[44,735,736,737],{},"测试调用：",[30,738,739],{},"curl http:\u002F\u002Flocalhost:8000\u002Fv1\u002Fchat\u002Fcompletions -H \"Content-Type: application\u002Fjson\" -d '{\"model\":\"meta-llama\u002FMeta-Llama-3-8B-Instruct\",\"messages\":[{\"role\":\"user\",\"content\":\"hi\"}]}'",[44,741,742,743,746],{},"多卡并行：加 ",[30,744,745],{},"--tensor-parallel-size 4","（卡数）",[44,748,749,750],{},"量化部署：",[30,751,752],{},"vllm serve TheBloke\u002FLlama-2-13B-AWQ --quantization awq",[44,754,755,756,759],{},"接入应用：任何 OpenAI SDK 改 ",[30,757,758],{},"base_url=http:\u002F\u002Flocalhost:8000\u002Fv1"," 即用",[21,761,203],{"id":203},[205,763,764,780],{},[208,765,766],{},[211,767,768,770,772,774,777],{},[214,769,216],{},[214,771,563],{},[214,773,221],{},[214,775,776],{},"TGI (HF)",[214,778,779],{},"TensorRT-LLM",[229,781,782,799,812,825,838,852,865,880],{},[211,783,784,787,790,793,796],{},[234,785,786],{},"吞吐（A100 8B）",[234,788,789],{},"~800-12500 tok\u002Fs",[234,791,792],{},"~40 tok\u002Fs",[234,794,795],{},"~500 tok\u002Fs",[234,797,798],{},"~10000 tok\u002Fs",[211,800,801,804,806,808,810],{},[234,802,803],{},"上手门槛",[234,805,326],{},[234,807,349],{},[234,809,326],{},[234,811,357],{},[211,813,814,816,818,820,823],{},[234,815,583],{},[234,817,273],{},[234,819,276],{},[234,821,822],{},"✅ (v0.7+)",[234,824,276],{},[211,826,827,830,832,834,836],{},[234,828,829],{},"连续批处理",[234,831,273],{},[234,833,276],{},[234,835,273],{},[234,837,273],{},[211,839,840,843,845,847,849],{},[234,841,842],{},"OpenAI 兼容",[234,844,273],{},[234,846,273],{},[234,848,273],{},[234,850,851],{},"需封装",[211,853,854,857,859,861,863],{},[234,855,856],{},"多模态",[234,858,279],{},[234,860,273],{},[234,862,273],{},[234,864,279],{},[211,866,867,870,873,876,878],{},[234,868,869],{},"Mac 支持",[234,871,872],{},"❌ 有限",[234,874,875],{},"✅ MLX",[234,877,276],{},[234,879,276],{},[211,881,882,885,888,890,893],{},[234,883,884],{},"开源协议",[234,886,887],{},"Apache 2.0",[234,889,337],{},[234,891,892],{},"HFOIL",[234,894,887],{},[21,896,360],{"id":360},[41,898,899,908,916,930,936,945],{},[44,900,901,904,905,907],{},[47,902,903],{},"冷启动慢不是 bug","：首次编译 CUDA kernel 需要几分钟，生产环境用 Docker 镜像预编译或加 ",[30,906,693],{},"（牺牲 15-20% 性能换即时启动）",[44,909,910,915],{},[47,911,912,914],{},[30,913,716],{}," 必设","：不设会按模型最大上下文预分配 KV cache，小显存直接 OOM",[44,917,918,921,922,925,926,929],{},[47,919,920],{},"量化模型要匹配版本","：AWQ 模型必须用 ",[30,923,924],{},"--quantization awq","，GPTQ 用 ",[30,927,928],{},"--quantization gptq","，混用会报错或精度崩",[44,931,932,935],{},[47,933,934],{},"不要在 Mac 上用 vLLM 跑生产","：Metal 后端是实验性的，性能远不如 CPU，Mac 本地推理用 Ollama \u002F MLX",[44,937,938,941,942,944],{},[47,939,940],{},"监控 GPU 显存碎片","：长跑后偶发显存碎片导致新请求 OOM，加 ",[30,943,700],{}," 留 buffer 或定期重启",[44,946,947,950],{},[47,948,949],{},"多模态模型看版本","：不同版本对 VLM 支持差异较大，新模型先查官方 issue 选适配版本",[21,952,396],{"id":395},[41,954,955,958,961,964,967,970,973,976],{},[44,956,957],{},"✅ 生产级 LLM API 服务（多用户并发、高吞吐）",[44,959,960],{},"✅ 大规模离线 batch 推理（数据标注、合成数据生成）",[44,962,963],{},"✅ 需要最低成本跑大模型（量化 + 单卡部署 70B）",[44,965,966],{},"✅ 有 NVIDIA GPU + Linux 运维能力的工程团队",[44,968,969],{},"❌ 单用户本地原型 \u002F 个人开发（用 Ollama，0 配置）",[44,971,972],{},"❌ Mac M 系列用户（Metal 支持有限，用 Ollama + MLX）",[44,974,975],{},"❌ 没有 GPU 的环境（vLLM 的 CPU 后端性能极差）",[44,977,978],{},"❌ 多模态 \u002F 语音模型生产部署（支持不稳定，看具体版本）",[21,980,982],{"id":981},"faq","FAQ",[26,984,985,988],{},[47,986,987],{},"Q: vLLM 和 Ollama 怎么选？","\nA: Ollama 是 Daemon + CLI，单用户原型极简；vLLM 是推理服务器，多用户并发吞吐高 16-20 倍。个人用 Ollama，对外提供服务用 vLLM。",[26,990,991,994],{},[47,992,993],{},"Q: 单卡能跑 70B 吗？","\nA: 可以。用 AWQ\u002FGPTQ 4-bit 量化，70B 约需 35-40GB 显存，A100 80GB 或 2×A100 40GB 张量并行。FP16 则需 140GB（2×A100 80GB）。",[26,996,997,1000],{},[47,998,999],{},"Q: 和 TensorRT-LLM 比谁快？","\nA: TensorRT-LLM 在极致优化下略快（5-15%），但需要编译 engine、调试周期长、模型适配少。vLLM 灵活性和生态好得多，综合性价比更高。",[26,1002,1003,1006],{},[47,1004,1005],{},"Q: 支持 AMD GPU 吗？","\nA: 部分支持。0.5+ 起 ROCm 后端可用，但稳定性、性能、生态都远不如 NVIDIA CUDA。生产环境仍建议 NVIDIA。",[21,1008,422],{"id":422},[26,1010,1011,1015,1016,1015,1020],{},[428,1012,1014],{"href":1013},"\u002Fcoding\u002Flocal\u002Fjan.html","Jan"," · ",[428,1017,1019],{"href":1018},"\u002Fcoding\u002Flocal\u002Fgpt4all.html","GPT4All",[428,1021,1023],{"href":1022},"\u002Fagent\u002Fdesktop\u002Fopen-interpreter.html","Open Interpreter",[21,1025,452],{"id":452},[118,1027,1028],{},[26,1029,1030],{},"本文的价格、版本号与性能数据均参考以下官方渠道整理，可能随时间变动，请以官方实时信息为准。",[41,1032,1033,1040],{},[44,1034,1035],{},[428,1036,1039],{"href":1037,"rel":1038},"https:\u002F\u002Fvllm.ai",[462],"官网",[44,1041,1042],{},[428,1043,1046],{"href":1044,"rel":1045},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",[462],"GitHub",{"title":478,"searchDepth":479,"depth":479,"links":1048},[1049,1050,1051,1052,1053,1054,1055,1056,1057,1058,1059],{"id":23,"depth":482,"text":24},{"id":39,"depth":482,"text":39},{"id":102,"depth":482,"text":102},{"id":644,"depth":482,"text":645},{"id":173,"depth":482,"text":173},{"id":203,"depth":482,"text":203},{"id":360,"depth":482,"text":360},{"id":395,"depth":482,"text":396},{"id":981,"depth":482,"text":982},{"id":422,"depth":482,"text":422},{"id":452,"depth":482,"text":452},"\u002Fimg\u002Ftools\u002Fvllm.webp","vLLM 真实评测：开源高吞吐 LLM 推理引擎（Apache 2.0 协议），核心创新 PagedAttention + 连续批处理，显著提升 GPU 利用率和推理吞吐。适合需要生产级高并发 LLM 服务部署、追求最大吞吐量的工程团队。",[511],"2026-07-30",{},"\u002Ftools\u002Fcoding\u002Flocal\u002Fvllm",[520],"Free \u002F 开源（Apache 2.0）","2026-07-05",{"power":537,"ux":479,"price":537,"cn_support":482,"stability":536},{"title":563,"description":1061},"vLLM - 高吞吐 LLM 推理引擎评测与部署 | AIHO","coding\u002Flocal\u002Fvllm",[1074,1075],{"title":1039,"url":1037},{"title":1046,"url":1044},"tools\u002Fcoding\u002Flocal\u002Fvllm","高吞吐 LLM 推理引擎，PagedAttention 连续批处理",[492,1079,1080,1081,1082],"inference-engine","production","paged-attention","gpu","生产级高并发 LLM 服务的首选推理引擎，PagedAttention + 连续批处理把单卡吞吐拉到极致；单用户原型和 Mac 本地玩用 Ollama \u002F LM Studio 更省心。","njZ35H6xUwwjCk237XJvzfgRSW0kRrEEdoBySqYygng",1785428443818]