[{"data":1,"prerenderedAt":2733},["ShallowReactive",2],{"header-counts":3,"footer-counts":6,"playbook-ai-agent\u002Fdify-self-host-knowledge-base":9,"playbook-tools-ai-agent\u002Fdify-self-host-knowledge-base":592},{"tools":4,"reviews":5},75,34,{"tools":4,"reviews":5,"playbooks":7,"news":8},33,27,{"id":10,"title":11,"body":12,"category":561,"cover":561,"description":562,"extension":563,"lastVerified":564,"meta":565,"navigation":203,"path":577,"published":564,"relatedTools":578,"seo":582,"seoTitle":583,"stem":584,"tags":585,"updated":564,"__hash__":591},"playbook\u002Fplaybook\u002Fai-agent\u002Fdify-self-host-knowledge-base.md","用 Dify 私有部署搭企业知识库（含完整 Docker Compose）",{"type":13,"value":14,"toc":548},"minimark",[15,19,39,50,53,115,118,122,169,175,239,263,282,285,345,348,352,357,407,411,424,429,433,436,462,465,471,477,490,493,539,544],[16,17,18],"h2",{"id":18},"一句话结论",[20,21,22,23,27,28,32,33,38],"p",{},"Dify 私有部署企业知识库是**「数据不出内网 + 工作流强」**场景的最优解之一。一条 ",[24,25,26],"code",{},"docker compose up -d"," 起完整栈（API \u002F worker \u002F web \u002F PostgreSQL \u002F Redis \u002F Weaviate），模型可接国产 API 或本地 Ollama \u002F vLLM，RAG 调优重点在 ",[29,30,31],"strong",{},"embedding 选型 + chunk 策略","。社区版 RAG 精度不如 ",[34,35,37],"a",{"href":36},"\u002Fagent\u002Fplatform\u002Ffastgpt.html","FastGPT","，但工作流能力碾压——要「知识库 + Agent + 工作流」三件套，Dify 无可替代。",[40,41,42],"blockquote",{},[20,43,44,45,49],{},"延伸阅读：",[34,46,48],{"href":47},"\u002Freview\u002Fdify-self-host-1-month.html","Dify 私有部署 1 个月运营记","（真实账单 + 踩坑）。",[16,51,52],{"id":52},"架构选型",[54,55,56,72],"table",{},[57,58,59],"thead",{},[60,61,62,66,69],"tr",{},[63,64,65],"th",{},"形态",[63,67,68],{},"适合",[63,70,71],{},"门槛",[73,74,75,89,102],"tbody",{},[60,76,77,83,86],{},[78,79,80],"td",{},[29,81,82],{},"单机 Docker Compose",[78,84,85],{},"中小团队（\u003C500 日活）",[78,87,88],{},"低，推荐起步",[60,90,91,96,99],{},[78,92,93],{},[29,94,95],{},"集群 \u002F K8s",[78,97,98],{},"日活上千、高可用",[78,100,101],{},"高",[60,103,104,109,112],{},[78,105,106],{},[29,107,108],{},"离线 \u002F  air-gapped",[78,110,111],{},"涉密单位",[78,113,114],{},"需离线镜像 + 本地模型",[20,116,117],{},"绝大多数企业从单机起步，8 核 16G 云主机 + 托管 PostgreSQL 足够撑内部几百人。",[16,119,121],{"id":120},"完整-docker-compose-配置","完整 Docker Compose 配置",[123,124,129],"pre",{"className":125,"code":126,"language":127,"meta":128,"style":128},"language-bash shiki shiki-themes github-light github-dark","git clone https:\u002F\u002Fgithub.com\u002Flanggenius\u002Fdify.git\ncd dify\u002Fdocker\ncp .env.example .env\n","bash","",[24,130,131,147,157],{"__ignoreMap":128},[132,133,136,140,144],"span",{"class":134,"line":135},"line",1,[132,137,139],{"class":138},"sScJk","git",[132,141,143],{"class":142},"sZZnC"," clone",[132,145,146],{"class":142}," https:\u002F\u002Fgithub.com\u002Flanggenius\u002Fdify.git\n",[132,148,150,154],{"class":134,"line":149},2,[132,151,153],{"class":152},"sj4cs","cd",[132,155,156],{"class":142}," dify\u002Fdocker\n",[132,158,160,163,166],{"class":134,"line":159},3,[132,161,162],{"class":138},"cp",[132,164,165],{"class":142}," .env.example",[132,167,168],{"class":142}," .env\n",[20,170,171,174],{},[24,172,173],{},".env"," 关键项：",[123,176,178],{"className":125,"code":177,"language":127,"meta":128,"style":128},"# 向量库（默认 Weaviate，也可换 pgvector \u002F Qdrant）\nVECTOR_STORE=weaviate\n\n# 模型代理（国内接国产模型走这里，不必每个 tool 配 key）\n# 在 Dify 控制台「设置 → 模型供应商」里填 key 即可\n\n# 文件上传上限（社区版默认 15MB，超了失败）\nUPLOAD_FILE_SIZE_LIMIT=50\n",[24,179,180,186,199,205,211,217,222,228],{"__ignoreMap":128},[132,181,182],{"class":134,"line":135},[132,183,185],{"class":184},"sJ8bj","# 向量库（默认 Weaviate，也可换 pgvector \u002F Qdrant）\n",[132,187,188,192,196],{"class":134,"line":149},[132,189,191],{"class":190},"sVt8B","VECTOR_STORE",[132,193,195],{"class":194},"szBVR","=",[132,197,198],{"class":142},"weaviate\n",[132,200,201],{"class":134,"line":159},[132,202,204],{"emptyLinePlaceholder":203},true,"\n",[132,206,208],{"class":134,"line":207},4,[132,209,210],{"class":184},"# 模型代理（国内接国产模型走这里，不必每个 tool 配 key）\n",[132,212,214],{"class":134,"line":213},5,[132,215,216],{"class":184},"# 在 Dify 控制台「设置 → 模型供应商」里填 key 即可\n",[132,218,220],{"class":134,"line":219},6,[132,221,204],{"emptyLinePlaceholder":203},[132,223,225],{"class":134,"line":224},7,[132,226,227],{"class":184},"# 文件上传上限（社区版默认 15MB，超了失败）\n",[132,229,231,234,236],{"class":134,"line":230},8,[132,232,233],{"class":190},"UPLOAD_FILE_SIZE_LIMIT",[132,235,195],{"class":194},[132,237,238],{"class":142},"50\n",[123,240,242],{"className":125,"code":241,"language":127,"meta":128,"style":128},"docker compose up -d\n# 默认 http:\u002F\u002Flocalhost，首次建 admin 账号\n",[24,243,244,258],{"__ignoreMap":128},[132,245,246,249,252,255],{"class":134,"line":135},[132,247,248],{"class":138},"docker",[132,250,251],{"class":142}," compose",[132,253,254],{"class":142}," up",[132,256,257],{"class":152}," -d\n",[132,259,260],{"class":134,"line":149},[132,261,262],{"class":184},"# 默认 http:\u002F\u002Flocalhost，首次建 admin 账号\n",[40,264,265],{},[20,266,267,270,271,273,274,277,278,281],{},[29,268,269],{},"AIHO 观点","：",[24,272,173],{}," 改完务必 ",[24,275,276],{},"docker compose down && up -d","——",[24,279,280],{},"restart"," 不重载 env，这是「改了不生效」最常见的坑。",[16,283,284],{"id":284},"模型接入",[54,286,287,299],{},[57,288,289],{},[60,290,291,294,297],{},[63,292,293],{},"模型线",[63,295,296],{},"接入方式",[63,298,68],{},[73,300,301,312,323,334],{},[60,302,303,306,309],{},[78,304,305],{},"OpenAI \u002F Claude",[78,307,308],{},"官方 provider + key",[78,310,311],{},"通用 \u002F 复杂推理",[60,313,314,317,320],{},[78,315,316],{},"国产（DeepSeek \u002F 通义 \u002F 文心 \u002F 豆包）",[78,318,319],{},"原生支持，填 key",[78,321,322],{},"国内 toB，零中转",[60,324,325,328,331],{},[78,326,327],{},"Ollama（Qwen2.5-32B）",[78,329,330],{},"本地 endpoint",[78,332,333],{},"脱敏任务、零 API 成本",[60,335,336,339,342],{},[78,337,338],{},"vLLM（自部署）",[78,340,341],{},"OpenAI 兼容 endpoint",[78,343,344],{},"高并发批量",[20,346,347],{},"国产模型原生支持是 Dify 国内流行关键——不像 FastGPT 需要 OneAPI 中转。",[16,349,351],{"id":350},"rag-调优embedding-选型-chunk-策略","RAG 调优：embedding 选型 + chunk 策略",[353,354,356],"h3",{"id":355},"embedding-选型","embedding 选型",[54,358,359,372],{},[57,360,361],{},[60,362,363,366,369],{},[63,364,365],{},"场景",[63,367,368],{},"推荐 embedding",[63,370,371],{},"理由",[73,373,374,385,396],{},[60,375,376,379,382],{},[78,377,378],{},"中文文档为主",[78,380,381],{},"bge-large-zh \u002F 阿里 text-embedding",[78,383,384],{},"中文召回优",[60,386,387,390,393],{},[78,388,389],{},"中英混合",[78,391,392],{},"OpenAI text-embedding-3",[78,394,395],{},"多语均衡",[60,397,398,401,404],{},[78,399,400],{},"本地化",[78,402,403],{},"Ollama 跑 bge \u002F nomic",[78,405,406],{},"数据不出机",[353,408,410],{"id":409},"chunk-策略","chunk 策略",[412,413,414,418,421],"ul",{},[415,416,417],"li",{},"默认 500 字符 \u002F 50 重叠 → 答非所问率约 30%",[415,419,420],{},"递归分块 1000 字符 \u002F 150 重叠 → 降到 ~15%",[415,422,423],{},"加外部 rerank（Cohere \u002F bge-reranker）→ 再 +10 个百分点",[40,425,426],{},[20,427,428],{},"社区版默认基础语义检索，多路召回 + 重排在企业版才解锁。纯知识库 QA 极致精度看 FastGPT；要工作流编排选 Dify。",[16,430,432],{"id":431},"权限模型部门-角色-知识库隔离","权限模型：部门 \u002F 角色 \u002F 知识库隔离",[20,434,435],{},"企业多部门场景：",[412,437,438,444,450,456],{},[415,439,440,443],{},[29,441,442],{},"知识库隔离","：每个部门建独立知识库，只授权本部门成员",[415,445,446,449],{},[29,447,448],{},"角色","：管理员（建应用）\u002F 编辑（传文档）\u002F 访客（只问）",[415,451,452,455],{},[29,453,454],{},"SSO","：企业版支持 SAML \u002F OIDC，对接内部账号体系",[415,457,458,461],{},[29,459,460],{},"审计","：企业版有操作日志，合规必需",[16,463,464],{"id":464},"常见问题",[20,466,467,470],{},[29,468,469],{},"Q：社区版够企业用吗？","\nA：中小团队够。但要 SSO \u002F 审计 \u002F 多路召回，得上企业版。",[20,472,473,476],{},[29,474,475],{},"Q：RAG 答不准先调什么？","\nA：先调 chunk 策略到 1000 字 + 重叠，再加 rerank，最后换 embedding。",[20,478,479,482,483,489],{},[29,480,481],{},"Q：和 FastGPT 怎么选？","\nA：纯 QA 精度 FastGPT 强；要工作流 + Agent + 私有化一体，Dify。详见 ",[34,484,488],{"href":485,"rel":486},"https:\u002F\u002Fwww.besthub.dev\u002Farticles\u002Fcoze-vs-dify-vs-fastgpt-which-ai-agent-platform-fits-your-needs-fa59cf97b798",[487],"nofollow","Coze vs Dify vs FastGPT","。",[16,491,492],{"id":492},"相关阅读",[412,494,495,511,517,528],{},[415,496,497,498,502,503,502,507],{},"工具卡：",[34,499,501],{"href":500},"\u002Fagent\u002Fplatform\u002Fdify.html","Dify"," ｜ ",[34,504,506],{"href":505},"\u002Fcoding\u002Flocal\u002Follama.html","Ollama",[34,508,510],{"href":509},"\u002Fcoding\u002Flocal\u002Fvllm.html","vLLM",[415,512,513,514],{},"评测：",[34,515,516],{"href":47},"Dify 私有部署 1 月记",[415,518,519,520,502,524],{},"对比：",[34,521,523],{"href":522},"\u002Fcompare\u002Fdify-vs-n8n.html","Dify vs n8n",[34,525,527],{"href":526},"\u002Fcompare\u002Fcoze-vs-dify.html","Coze vs Dify",[415,529,530,531,502,535],{},"概念：",[34,532,534],{"href":533},"\u002Fwiki\u002Frag.html","RAG",[34,536,538],{"href":537},"\u002Fwiki\u002Fmcp.html","MCP",[40,540,541],{},[20,542,543],{},"来源说明：本文基于 docs.dify.ai 官方文档、langgenius\u002Fdify GitHub、第三方自托管指南及 AIHO 编辑部实践归纳。版本号会变，部署要求以官方最新文档为准。",[545,546,547],"style",{},"html pre.shiki code .sScJk, html code.shiki .sScJk{--shiki-default:#6F42C1;--shiki-dark:#B392F0}html pre.shiki code .sZZnC, html code.shiki .sZZnC{--shiki-default:#032F62;--shiki-dark:#9ECBFF}html pre.shiki code .sj4cs, html code.shiki .sj4cs{--shiki-default:#005CC5;--shiki-dark:#79B8FF}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html pre.shiki code .sJ8bj, html code.shiki .sJ8bj{--shiki-default:#6A737D;--shiki-dark:#6A737D}html pre.shiki code .sVt8B, html code.shiki .sVt8B{--shiki-default:#24292E;--shiki-dark:#E1E4E8}html pre.shiki code .szBVR, html code.shiki .szBVR{--shiki-default:#D73A49;--shiki-dark:#F97583}",{"title":128,"searchDepth":159,"depth":159,"links":549},[550,551,552,553,554,558,559,560],{"id":18,"depth":149,"text":18},{"id":52,"depth":149,"text":52},{"id":120,"depth":149,"text":121},{"id":284,"depth":149,"text":284},{"id":350,"depth":149,"text":351,"children":555},[556,557],{"id":355,"depth":159,"text":356},{"id":409,"depth":159,"text":410},{"id":431,"depth":149,"text":432},{"id":464,"depth":149,"text":464},{"id":492,"depth":149,"text":492},null,"Dify 私有部署企业知识库 2026 实战：架构选型（单机 \u002F 集群 \u002F 离线）、完整 Docker Compose 配置（含模型代理）、模型接入（OpenAI \u002F Claude \u002F Ollama \u002F vLLM）、RAG 调优（embedding 选型 + chunk 策略）、权限模型（部门 \u002F 角色 \u002F 知识库隔离）。","md","2026-08-02",{"verdict":566,"sources":567},"Dify 私有部署企业知识库是「数据不出内网 + 工作流强」的最优解之一。一条 docker compose 起完整栈，模型接国产或本地，RAG 调优重点在 embedding 选型和 chunk 策略。社区版 RAG 精度不如 FastGPT，但工作流能力碾压。",[568,571,574],{"title":569,"url":570},"Dify 官方文档（中文）","https:\u002F\u002Fdocs.dify.ai\u002Fzh-hans",{"title":572,"url":573},"Dify GitHub","https:\u002F\u002Fgithub.com\u002Flanggenius\u002Fdify",{"title":575,"url":576},"Dify Self-Hosted Guide 2026","https:\u002F\u002Fjoshuaopolko.com\u002Fdify-self-hosted-guide","\u002Fplaybook\u002Fai-agent\u002Fdify-self-host-knowledge-base",[579,580,581],"agent\u002Fplatform\u002Fdify","coding\u002Flocal\u002Follama","coding\u002Flocal\u002Fvllm",{"title":11,"description":562},"Dify 私有部署企业知识库 2026：Docker Compose、模型接入与 RAG 调优","playbook\u002Fai-agent\u002Fdify-self-host-knowledge-base",[586,587,588,589,590,248],"dify","私有部署","知识库","rag","企业","hYp2wpvBnSFSM0e2V5CEgmX0BuNA15q0aiibLmBpoIg",[593,1688,2210],{"id":594,"title":501,"alternatives":595,"api_compatible":600,"body":607,"category":1624,"chinese_friendly":207,"cover":1625,"description":1626,"domestic":203,"extension":563,"faq":561,"free":203,"github":573,"languages":1627,"lastVerified":564,"meta":1631,"models":561,"navigation":203,"notSuitable":561,"opensource":203,"path":1632,"pillar":1633,"platforms":1634,"priceTable":1638,"pricing":1655,"published":1656,"relatedPlaybooks":1657,"relatedReviews":1659,"score":1665,"self_host":203,"seo":1666,"seoTitle":1667,"slug":579,"sources":1668,"stem":1676,"suitable":561,"tagline":1677,"tags":1678,"updated":1685,"verdict":1686,"website":1567,"__hash__":1687},"tools\u002Ftools\u002Fagent\u002Fplatform\u002Fdify.md",[596,597,598,599],"agent\u002Fplatform\u002Fcoze","agent\u002Fplatform\u002Ffastgpt","agent\u002Fplatform\u002Fn8n","agent\u002Fplatform\u002Flangflow",[601,602,603,604,605,606],"OpenAI","Anthropic","百度文心","阿里通义","Moonshot Kimi","DeepSeek",{"type":13,"value":608,"toc":1602},[609,613,638,643,646,650,653,722,725,729,732,747,763,767,770,781,785,792,803,807,810,813,817,826,887,894,898,905,947,950,969,973,976,1036,1042,1046,1136,1139,1168,1171,1311,1328,1367,1370,1437,1441,1444,1464,1467,1496,1498,1557,1560,1591,1599],[16,610,612],{"id":611},"tldr","TL;DR",[614,615,620,626],"div",{"className":616},[617,618,619],"card","p-5","my-4",[20,621,622,625],{},[29,623,624],{},"一句话："," Dify 是开源 LLMOps 平台的事实标准。GitHub 13 万 star、累计 100 万+ 生产 app（据 chatforest.com 2026 评测引用 Dify 官方数据），把\"可视化工作流编排 + RAG 知识库 + Agent + MCP 协议\"打包成一个 Docker Compose 能跑起来的东西。",[20,627,628,629,632,633,637],{},"最大价值是 ",[29,630,631],{},"完全开源 + 模型不挑食","——同一个工作流里同时调 OpenAI、Anthropic、Ollama 本地、DeepSeek、Qwen 都行。代价是部署比 ",[34,634,636],{"href":635},"\u002Fagent\u002Fplatform\u002Fcoze.html","Coze"," 折腾，新手得读 1-2 小时文档。",[40,639,640],{},[20,641,642],{},"来源说明：本文基于 docs.dify.ai 官方文档、langgenius\u002Fdify GitHub 仓库、第三方评测（besthub.dev \u002F chatforest.com \u002F joshuaopolko.com \u002F zhihu 知名专栏）综合归纳。版本号会变，部署要求请以官方最新文档为准。",[16,644,645],{"id":645},"核心特性",[353,647,649],{"id":648},"可视化工作流chatflow-workflow","可视化工作流（Chatflow + Workflow）",[20,651,652],{},"Dify 把 LLM 应用拆成两种\"应用类型\"：",[54,654,655,668],{},[57,656,657],{},[60,658,659,662,665],{},[63,660,661],{},"类型",[63,663,664],{},"适合场景",[63,666,667],{},"编排范式",[73,669,670,683,696,709],{},[60,671,672,677,680],{},[78,673,674],{},[29,675,676],{},"Chatbot",[78,678,679],{},"简单对话机器人",[78,681,682],{},"prompt + tools",[60,684,685,690,693],{},[78,686,687],{},[29,688,689],{},"Agent",[78,691,692],{},"自主多步任务",[78,694,695],{},"ReAct \u002F Function Calling",[60,697,698,703,706],{},[78,699,700],{},[29,701,702],{},"Chatflow",[78,704,705],{},"对话型工作流（多轮 + 分支）",[78,707,708],{},"节点 DAG，带聊天上下文",[60,710,711,716,719],{},[78,712,713],{},[29,714,715],{},"Workflow",[78,717,718],{},"单次输入→输出（API 模式）",[78,720,721],{},"节点 DAG，无对话状态",[20,723,724],{},"节点类型覆盖：LLM、知识检索、HTTP 请求、代码执行（Python \u002F JS）、条件分支、迭代、变量聚合、参数提取、问题分类——满足\"用拖拽实现可观测的 LLM pipeline\"。",[353,726,728],{"id":727},"rag-知识库","RAG 知识库",[20,730,731],{},"内置完整 RAG 链路：",[733,734,735,738,741,744],"ol",{},[415,736,737],{},"上传文档（PDF \u002F Word \u002F Markdown \u002F 网页）",[415,739,740],{},"自动分块 + embedding（可配置分段策略和 embedding 模型）",[415,742,743],{},"混合检索（向量 + 全文 + 重排）",[415,745,746],{},"引用溯源（回答末尾自动附原文片段）",[20,748,749,750,755,756,759,760,762],{},"注意：根据 ",[34,751,754],{"href":752,"rel":753},"https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F1887141987838309480",[487],"知乎 LLM 实战笔记 2025-03 对比"," 的实测，Dify ",[29,757,758],{},"社区版默认是基础语义检索","，企业版才解锁多路召回 + 重排。RAG 极致精度场景仍推荐 ",[34,761,37],{"href":36},"（实测准确率高 10+ 个百分点），Dify 胜在工作流而非纯 RAG。",[353,764,766],{"id":765},"模型生态40-提供商","模型生态：40+ 提供商",[20,768,769],{},"Dify 通过插件市场接入主流模型——OpenAI、Anthropic、Google Gemini、Azure、AWS Bedrock、Cohere、xAI、DeepSeek、Qwen、智谱、文心、豆包、月之暗面、Ollama、LM Studio、Replicate、Together AI、OpenRouter……几乎你能数出来的 LLM 提供商都在。",[20,771,772,773,775,776,780],{},"国产模型原生支持（不像 ",[34,774,37],{"href":36}," 需要 ",[34,777,779],{"href":778},"\u002Fcoding\u002Fapi\u002Fone-api.html","OneAPI"," 中转），是 Dify 在国内 toB 场景流行的关键。",[353,782,784],{"id":783},"mcp-协议支持","MCP 协议支持",[20,786,787,788,791],{},"Dify 较早接入了 ",[34,789,790],{"href":537},"MCP（Model Context Protocol）","，工作流可以直接调 MCP Server 暴露的 tools。意味着你可以让 Dify 工作流：",[412,793,794,797,800],{},[415,795,796],{},"通过 MCP 调本地 PostgreSQL \u002F SQLite",[415,798,799],{},"通过 MCP 调 GitHub \u002F Slack \u002F Linear",[415,801,802],{},"通过 MCP 调自家内部系统（写一个 MCP Server 即可）",[353,804,806],{"id":805},"api-first","API-first",[20,808,809],{},"每个 app 自动暴露 REST API，参数和返回结构自动生成 OpenAPI Schema。集成到自家产品里不需要写包装代码，给前端 \u002F 微信小程序 \u002F 飞书机器人调用都方便。",[16,811,812],{"id":812},"价格与运行成本",[353,814,816],{"id":815},"云版difyai","云版（dify.ai）",[20,818,819,820,825],{},"根据 ",[34,821,824],{"href":822,"rel":823},"https:\u002F\u002Fwww.tooljunction.io\u002Fai-tools\u002Fdify-ai",[487],"tooljunction.io 2026 评测"," 引用的官方定价：",[54,827,828,841],{},[57,829,830],{},[60,831,832,835,838],{},[63,833,834],{},"套餐",[63,836,837],{},"价格",[63,839,840],{},"主要限制",[73,842,843,854,865,876],{},[60,844,845,848,851],{},[78,846,847],{},"Sandbox",[78,849,850],{},"免费",[78,852,853],{},"200 次模型调用，1 app，5MB 知识库",[60,855,856,859,862],{},[78,857,858],{},"Professional",[78,860,861],{},"$59\u002F月起",[78,863,864],{},"5000 调用\u002F月，多 app，50MB 知识库",[60,866,867,870,873],{},[78,868,869],{},"Team",[78,871,872],{},"$159\u002F月起",[78,874,875],{},"团队协作、SSO",[60,877,878,881,884],{},[78,879,880],{},"Enterprise",[78,882,883],{},"联系销售",[78,885,886],{},"定制 SLA、私有云",[20,888,889,890,893],{},"注意：云版价格只是 Dify 平台费，",[29,891,892],{},"模型 API 费用另算","（自带 OpenAI \u002F Anthropic key）。",[353,895,897],{"id":896},"自托管推荐","自托管（推荐）",[20,899,900,904],{},[34,901,903],{"href":573,"rel":902},[487],"官方 GitHub 仓库"," 提供 Docker Compose 部署，社区版完全免费可商用：",[123,906,908],{"className":125,"code":907,"language":127,"meta":128,"style":128},"git clone https:\u002F\u002Fgithub.com\u002Flanggenius\u002Fdify.git\ncd dify\u002Fdocker\ncp .env.example .env\ndocker compose up -d\n# 默认 http:\u002F\u002Flocalhost \u002F 端口可在 .env 调整\n",[24,909,910,918,924,932,942],{"__ignoreMap":128},[132,911,912,914,916],{"class":134,"line":135},[132,913,139],{"class":138},[132,915,143],{"class":142},[132,917,146],{"class":142},[132,919,920,922],{"class":134,"line":149},[132,921,153],{"class":152},[132,923,156],{"class":142},[132,925,926,928,930],{"class":134,"line":159},[132,927,162],{"class":138},[132,929,165],{"class":142},[132,931,168],{"class":142},[132,933,934,936,938,940],{"class":134,"line":207},[132,935,248],{"class":138},[132,937,251],{"class":142},[132,939,254],{"class":142},[132,941,257],{"class":152},[132,943,944],{"class":134,"line":213},[132,945,946],{"class":184},"# 默认 http:\u002F\u002Flocalhost \u002F 端口可在 .env 调整\n",[20,948,949],{},"硬件门槛（社区共识，非官方硬性要求）：",[412,951,952,958,964],{},[415,953,954,957],{},[29,955,956],{},"最低","：2 核 4G，纯外接 API 模式",[415,959,960,963],{},[29,961,962],{},"推荐","：4 核 8G + 至少 30GB 磁盘（向量数据 + 文件存储）",[415,965,966,968],{},[29,967,590],{},"：8 核 16G+，单机日活上千",[353,970,972],{"id":971},"真实-tco","真实 TCO",[20,974,975],{},"按一家中小团队 3 年场景估算（基于上面引用的多份评测交叉对比）：",[54,977,978,991],{},[57,979,980],{},[60,981,982,985,988],{},[63,983,984],{},"成本项",[63,986,987],{},"云版 Professional",[63,989,990],{},"自托管",[73,992,993,1004,1014,1025],{},[60,994,995,998,1001],{},[78,996,997],{},"平台费",[78,999,1000],{},"~$2,100（3 年）",[78,1002,1003],{},"$0",[60,1005,1006,1009,1011],{},[78,1007,1008],{},"服务器",[78,1010,1003],{},[78,1012,1013],{},"~$50\u002F月 × 36 = $1,800",[60,1015,1016,1019,1022],{},[78,1017,1018],{},"模型 API",[78,1020,1021],{},"与下同",[78,1023,1024],{},"与上同",[60,1026,1027,1030,1033],{},[78,1028,1029],{},"运维人力",[78,1031,1032],{},"0",[78,1034,1035],{},"约 0.2 人月",[20,1037,1038,1041],{},[29,1039,1040],{},"结论","：日活 \u003C 100 用云版省心；> 500 或数据敏感场景自托管 ROI 更好。",[16,1043,1045],{"id":1044},"上手-10-分钟","上手 10 分钟",[123,1047,1049],{"className":125,"code":1048,"language":127,"meta":128,"style":128},"# 1. 自托管（社区版）\ngit clone https:\u002F\u002Fgithub.com\u002Flanggenius\u002Fdify.git\ncd dify\u002Fdocker\ncp .env.example .env\ndocker compose up -d\n\n# 2. 浏览器打开 http:\u002F\u002Flocalhost\n#    首次会让你创建 admin 账号\n\n# 3. 进入\"设置 → 模型供应商\"，配置 OpenAI \u002F 国产模型 API key\n\n# 4. 在主界面\"创建空白应用\"，选 Chatflow 或 Workflow\n# 5. 拖入\"开始 → LLM → 结束\"节点试一下基础 prompt\n# 6. 满意了点右上\"发布\"，自动生成 API endpoint\n",[24,1050,1051,1056,1064,1070,1078,1088,1092,1097,1102,1107,1113,1118,1124,1130],{"__ignoreMap":128},[132,1052,1053],{"class":134,"line":135},[132,1054,1055],{"class":184},"# 1. 自托管（社区版）\n",[132,1057,1058,1060,1062],{"class":134,"line":149},[132,1059,139],{"class":138},[132,1061,143],{"class":142},[132,1063,146],{"class":142},[132,1065,1066,1068],{"class":134,"line":159},[132,1067,153],{"class":152},[132,1069,156],{"class":142},[132,1071,1072,1074,1076],{"class":134,"line":207},[132,1073,162],{"class":138},[132,1075,165],{"class":142},[132,1077,168],{"class":142},[132,1079,1080,1082,1084,1086],{"class":134,"line":213},[132,1081,248],{"class":138},[132,1083,251],{"class":142},[132,1085,254],{"class":142},[132,1087,257],{"class":152},[132,1089,1090],{"class":134,"line":219},[132,1091,204],{"emptyLinePlaceholder":203},[132,1093,1094],{"class":134,"line":224},[132,1095,1096],{"class":184},"# 2. 浏览器打开 http:\u002F\u002Flocalhost\n",[132,1098,1099],{"class":134,"line":230},[132,1100,1101],{"class":184},"#    首次会让你创建 admin 账号\n",[132,1103,1105],{"class":134,"line":1104},9,[132,1106,204],{"emptyLinePlaceholder":203},[132,1108,1110],{"class":134,"line":1109},10,[132,1111,1112],{"class":184},"# 3. 进入\"设置 → 模型供应商\"，配置 OpenAI \u002F 国产模型 API key\n",[132,1114,1116],{"class":134,"line":1115},11,[132,1117,204],{"emptyLinePlaceholder":203},[132,1119,1121],{"class":134,"line":1120},12,[132,1122,1123],{"class":184},"# 4. 在主界面\"创建空白应用\"，选 Chatflow 或 Workflow\n",[132,1125,1127],{"class":134,"line":1126},13,[132,1128,1129],{"class":184},"# 5. 拖入\"开始 → LLM → 结束\"节点试一下基础 prompt\n",[132,1131,1133],{"class":134,"line":1132},14,[132,1134,1135],{"class":184},"# 6. 满意了点右上\"发布\"，自动生成 API endpoint\n",[16,1137,1138],{"id":1138},"国内使用注意事项",[733,1140,1141,1147,1153,1159],{},[415,1142,1143,1146],{},[29,1144,1145],{},"云版 dify.ai 直连国内访问稳定但需要付款","——支持国际信用卡 \u002F Stripe",[415,1148,1149,1152],{},[29,1150,1151],{},"自托管 + 国产模型"," = 完全国内闭环，是 Dify 在国内最大优势",[415,1154,1155,1158],{},[29,1156,1157],{},"Docker 镜像拉取","：国内可能慢，建议配 Docker registry 镜像（阿里云 \u002F 网易）",[415,1160,1161,1164,1165,1167],{},[29,1162,1163],{},"数据合规","：完全自托管时，数据零外泄；某些金融 \u002F 政府客户因此从 ",[34,1166,636],{"href":635}," 迁到 Dify",[16,1169,1170],{"id":1170},"与同类怎么选",[54,1172,1173,1196],{},[57,1174,1175],{},[60,1176,1177,1180,1182,1186,1190],{},[63,1178,1179],{},"维度",[63,1181,501],{},[63,1183,1184],{},[34,1185,636],{"href":635},[63,1187,1188],{},[34,1189,37],{"href":36},[63,1191,1192],{},[34,1193,1195],{"href":1194},"\u002Fagent\u002Fplatform\u002Fn8n.html","n8n",[73,1197,1198,1214,1226,1242,1256,1270,1284,1297],{},[60,1199,1200,1203,1206,1209,1211],{},[78,1201,1202],{},"开源",[78,1204,1205],{},"✅",[78,1207,1208],{},"❌",[78,1210,1205],{},[78,1212,1213],{},"✅（fair-code）",[60,1215,1216,1218,1220,1222,1224],{},[78,1217,587],{},[78,1219,1205],{},[78,1221,1208],{},[78,1223,1205],{},[78,1225,1205],{},[60,1227,1228,1231,1234,1237,1239],{},[78,1229,1230],{},"上手难度",[78,1232,1233],{},"★★★☆☆",[78,1235,1236],{},"★★☆☆☆ 最简单",[78,1238,1233],{},[78,1240,1241],{},"★★★★☆",[60,1243,1244,1247,1250,1252,1254],{},[78,1245,1246],{},"工作流编排",[78,1248,1249],{},"★★★★★",[78,1251,1241],{},[78,1253,1233],{},[78,1255,1249],{},[60,1257,1258,1261,1263,1265,1267],{},[78,1259,1260],{},"RAG 精度",[78,1262,1241],{},[78,1264,1233],{},[78,1266,1249],{},[78,1268,1269],{},"★★☆☆☆",[60,1271,1272,1275,1277,1279,1282],{},[78,1273,1274],{},"模型生态",[78,1276,1249],{},[78,1278,1241],{},[78,1280,1281],{},"★★★☆☆（OneAPI 中转）",[78,1283,1241],{},[60,1285,1286,1289,1291,1293,1295],{},[78,1287,1288],{},"中文场景",[78,1290,1241],{},[78,1292,1249],{},[78,1294,1241],{},[78,1296,1233],{},[60,1298,1299,1302,1304,1307,1309],{},[78,1300,1301],{},"字节生态绑定",[78,1303,1208],{},[78,1305,1306],{},"✅（飞书\u002F抖音深度集成）",[78,1308,1208],{},[78,1310,1208],{},[20,1312,1313,1316,1317,1321,1322,1327],{},[29,1314,1315],{},"怎么选","（基于 ",[34,1318,1320],{"href":485,"rel":1319},[487],"BestHub 2025-07"," 和 ",[34,1323,1326],{"href":1324,"rel":1325},"https:\u002F\u002Fwww.cnblogs.com\u002Fuulucias\u002Fp\u002F19449008",[487],"博客园 2026-01"," 两份选型指南综合）：",[412,1329,1330,1336,1344,1351,1358],{},[415,1331,1332,1335],{},[29,1333,1334],{},"数据必须不出内网 + 工作流复杂"," → Dify",[415,1337,1338,1341,1342],{},[29,1339,1340],{},"个人 \u002F 小团队 \u002F 快速原型 + 字节生态"," → ",[34,1343,636],{"href":635},[415,1345,1346,1341,1349],{},[29,1347,1348],{},"核心场景就是企业知识库 QA",[34,1350,37],{"href":36},[415,1352,1353,1341,1356],{},[29,1354,1355],{},"重点是连接外部 SaaS（Slack \u002F Notion \u002F 数据库）",[34,1357,1195],{"href":1194},[415,1359,1360,1341,1363],{},[29,1361,1362],{},"要画图式表达 LangChain pipeline",[34,1364,1366],{"href":1365},"\u002Fagent\u002Fplatform\u002Flangflow.html","Langflow",[16,1368,1369],{"id":1369},"避坑清单",[412,1371,1372,1378,1391,1401,1413,1419,1425,1431],{},[415,1373,1374,1377],{},[29,1375,1376],{},"社区版与企业版差距比想象大","：多路召回 \u002F 重排序 \u002F 单点登录 \u002F 审计日志都在企业版。社区版做生产前心里要有数。",[415,1379,1380,270,1385,1387,1388,1390],{},[29,1381,1382,1384],{},[24,1383,173],{}," 文件改完忘 restart",[24,1386,276],{},"，不是 ",[24,1389,280],{},"——后者不重新加载 env。",[415,1392,1393,270,1396,1400],{},[29,1394,1395],{},"大版本升级会破坏数据库 schema",[34,1397,1399],{"href":570,"rel":1398},[487],"官方升级文档"," 有详细 migration 步骤，跨大版本（如 0.x → 1.x）务必先备份 PostgreSQL 卷。生产环境强烈建议跑 staging 完整验证后再升。",[415,1402,1403,1406,1407,1409,1410,1412],{},[29,1404,1405],{},"RAG 文件大小社区版默认 15MB","：根据上述知乎实测，超过会失败。改 ",[24,1408,173],{}," 的 ",[24,1411,233],{}," 并重启容器。",[415,1414,1415,1418],{},[29,1416,1417],{},"代码节点的 Sandbox 性能差","：内置代码执行节点跑在隔离容器里启动慢、内存小。生产高频用建议改成 HTTP 节点调外部服务。",[415,1420,1421,1424],{},[29,1422,1423],{},"工作流\"迭代节点\"循环上限","：默认 10 次，复杂 ReAct agent 容易撞天花板，需要在节点设置里调高。",[415,1426,1427,1430],{},[29,1428,1429],{},"Dify Plugin 系统是新东西","：1.0 后引入的 Plugin 体系替代了原来的 Tools\u002FModels 配置方式，老教程可能已过时——以最新官方文档为准。",[415,1432,1433,1436],{},[29,1434,1435],{},"国内 Docker 拉取镜像慢","：先配国内 registry，否则首次 pull 可能要 30+ 分钟。",[16,1438,1440],{"id":1439},"适合-不适合","适合 \u002F 不适合",[20,1442,1443],{},"✅ 适合：",[412,1445,1446,1449,1452,1455,1458,1461],{},[415,1447,1448],{},"中大型企业 LLM 中台建设",[415,1450,1451],{},"需要私有化部署（金融 \u002F 医疗 \u002F 政府）",[415,1453,1454],{},"想做\"AI 工作流即产品\"的开发团队",[415,1456,1457],{},"同时需要 RAG + Agent + Workflow 三件套",[415,1459,1460],{},"想用国产模型 + 国际模型混合编排",[415,1462,1463],{},"已经接受 Docker + 一定运维投入",[20,1465,1466],{},"❌ 不适合：",[412,1468,1469,1475,1481,1484,1490],{},[415,1470,1471,1472,1474],{},"纯个人玩家做对话机器人（",[34,1473,636],{"href":635}," 更快）",[415,1476,1477,1478,1480],{},"只想做企业知识库 QA（",[34,1479,37],{"href":36}," RAG 更专）",[415,1482,1483],{},"团队完全没运维能力（云版还行，自托管会踩坑）",[415,1485,1486,1487,1489],{},"需要深度对接字节飞书 \u002F 抖音（",[34,1488,636],{"href":635}," 原生）",[415,1491,1492,1493,1495],{},"工作流核心是连接 100+ SaaS（",[34,1494,1195],{"href":1194}," 节点更全）",[16,1497,492],{"id":492},[412,1499,1500,1512,1527,1546],{},[415,1501,1502,1503,1505,1506,1505,1508,1505,1510],{},"同类对比：",[34,1504,636],{"href":635}," \u002F ",[34,1507,37],{"href":36},[34,1509,1195],{"href":1194},[34,1511,1366],{"href":1365},[415,1513,1514,1515,1505,1519,1505,1521,1505,1523],{},"概念基础：",[34,1516,1518],{"href":1517},"\u002Fwiki\u002Fai-agent.html","AI Agent",[34,1520,534],{"href":533},[34,1522,538],{"href":537},[34,1524,1526],{"href":1525},"\u002Fwiki\u002Ffunction-calling.html","Function Calling",[415,1528,1529,1530,1505,1534,1505,1538,1505,1542],{},"模型选型：",[34,1531,1533],{"href":1532},"\u002Fmodels\u002Fgpt-5.html","GPT-5",[34,1535,1537],{"href":1536},"\u002Fmodels\u002Fclaude-sonnet-4.html","Claude Sonnet 4",[34,1539,1541],{"href":1540},"\u002Fmodels\u002Fdeepseek-v3.html","DeepSeek-V3",[34,1543,1545],{"href":1544},"\u002Fmodels\u002Fglm-5.2.html","GLM-5.2",[415,1547,1548,1549,1505,1553],{},"进阶：",[34,1550,1552],{"href":1551},"\u002Fwiki\u002Ffine-tuning-vs-rag.html","Fine-tuning vs RAG",[34,1554,1556],{"href":1555},"\u002Fwiki\u002Fcontext-engineering.html","Context Engineering",[16,1558,1559],{"id":1559},"来源",[412,1561,1562,1569,1575,1581,1588],{},[415,1563,1564,1565],{},"官网：",[34,1566,1567],{"href":1567,"rel":1568},"https:\u002F\u002Fdify.ai",[487],[415,1570,1571,1572],{},"中文文档：",[34,1573,570],{"href":570,"rel":1574},[487],[415,1576,1577,1578],{},"GitHub：",[34,1579,573],{"href":573,"rel":1580},[487],[415,1582,1583,1584],{},"官方定价：",[34,1585,1586],{"href":1586,"rel":1587},"https:\u002F\u002Fdify.ai\u002Fpricing",[487],[415,1589,1590],{},"第三方评测：tooljunction.io \u002F chatforest.com \u002F besthub.dev \u002F joshuaopolko.com \u002F 知乎 LLM 实战笔记",[20,1592,1593,1594,1598],{},"本卡片由 AIHO 编辑部根据官方公开资料与第三方评测整理。所有事实点均标注来源；如发现版本号 \u002F 价格 \u002F 功能与最新官方信息不一致，请通过 ",[34,1595,1597],{"href":1596},"mailto:hello@aiho.net","反馈邮箱"," 反馈。",[545,1600,1601],{},"html pre.shiki code .sScJk, html code.shiki .sScJk{--shiki-default:#6F42C1;--shiki-dark:#B392F0}html pre.shiki code .sZZnC, html code.shiki .sZZnC{--shiki-default:#032F62;--shiki-dark:#9ECBFF}html pre.shiki code .sj4cs, html code.shiki .sj4cs{--shiki-default:#005CC5;--shiki-dark:#79B8FF}html pre.shiki code .sJ8bj, html code.shiki .sJ8bj{--shiki-default:#6A737D;--shiki-dark:#6A737D}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}",{"title":128,"searchDepth":159,"depth":159,"links":1603},[1604,1605,1612,1617,1618,1619,1620,1621,1622,1623],{"id":611,"depth":149,"text":612},{"id":645,"depth":149,"text":645,"children":1606},[1607,1608,1609,1610,1611],{"id":648,"depth":159,"text":649},{"id":727,"depth":159,"text":728},{"id":765,"depth":159,"text":766},{"id":783,"depth":159,"text":784},{"id":805,"depth":159,"text":806},{"id":812,"depth":149,"text":812,"children":1613},[1614,1615,1616],{"id":815,"depth":159,"text":816},{"id":896,"depth":159,"text":897},{"id":971,"depth":159,"text":972},{"id":1044,"depth":149,"text":1045},{"id":1138,"depth":149,"text":1138},{"id":1170,"depth":149,"text":1170},{"id":1369,"depth":149,"text":1369},{"id":1439,"depth":149,"text":1440},{"id":492,"depth":149,"text":492},{"id":1559,"depth":149,"text":1559},"platform","\u002Fimg\u002Ftools\u002Fdify.webp","Dify 2026 真实评测：开源 LLMOps 与 AI Agent 平台，集工作流编排、RAG 知识库、Agent、MCP 和多模型接入于一体。本文对比 Coze、FastGPT、n8n，整理自托管部署、云版价格、适合团队和避坑建议。",[1628,1629,1630],"zh","en","ja",{},"\u002Ftools\u002Fagent\u002Fplatform\u002Fdify","agent",[1635,1636,1637,248],"windows","macos","linux",[1639,1643,1647,1651],{"plan":1640,"price":1003,"features":1641,"notes":1642},"Self-hosted（开源版）","Docker 一键部署 + 全部核心功能（工作流 \u002F RAG \u002F Agent \u002F MCP）+ 接任意模型 API","私有部署 \u002F 完全免费 \u002F Apache 2.0",{"plan":1644,"price":1003,"features":1645,"notes":1646},"Cloud Sandbox（免费云）","官方托管试水档，含基础调用配额","免运维 \u002F 试水 POC",{"plan":1648,"price":861,"features":1649,"notes":1650},"Cloud Professional","更高调用额度 + 团队协作 + 商用支持","商用云首选",{"plan":1652,"price":1653,"features":1654,"notes":883},"Cloud Team \u002F Enterprise","Custom","更大配额 + SLA + 私有部署支持 + 合规","云版 SaaS（免费档 \u002F Professional $59\u002F月起） + 开源自托管完全免费","2026-06-18",[1658],"ai-agent\u002Fdify-self-host-knowledge-base",[1660,1661,1662,1663,1664],"coze-deep-review","coze-vs-dify","dify-deep-review","dify-self-host-1-month","fastgpt-deep-review",{"power":213,"ux":207,"price":213,"cn_support":207,"stability":207},{"title":501,"description":1626},"Dify 评测 2026：开源 LLMOps 与 AI Agent 平台，自托管指南",[1669,1670,1671,1673,1675],{"title":569,"url":570},{"title":572,"url":573},{"title":1672,"url":1586},"Dify 官方定价",{"title":1674,"url":485},"Coze vs Dify vs FastGPT 选型",{"title":575,"url":576},"tools\u002Fagent\u002Fplatform\u002Fdify","开源 LLMOps 平台，私有部署 Agent 首选",[1679,1680,1681,589,1682,1683,1684],"agent-platform","opensource","self-host","workflow","llmops","mcp","2026-06-24","想私有部署、想接全球任意模型，Dify 是答案。比 Coze 工程化、上手陡一点；比 FastGPT 工作流强、RAG 略弱。","EnNc9Kkmi_WvBZAYV3av9TFaKpLjmBxmCtV5_xRvi9Q",{"id":1689,"title":506,"alternatives":1690,"api_compatible":1695,"body":1704,"category":2152,"chinese_friendly":159,"cover":2153,"description":2154,"domestic":2155,"extension":563,"faq":2156,"free":203,"github":2169,"languages":2170,"lastVerified":564,"meta":2171,"models":561,"navigation":203,"notSuitable":561,"opensource":203,"path":2172,"pillar":2173,"platforms":2174,"priceTable":2175,"pricing":2180,"published":2181,"relatedPlaybooks":2182,"relatedReviews":2185,"score":2186,"self_host":203,"seo":2187,"seoTitle":2188,"slug":580,"sources":2189,"stem":2196,"suitable":561,"tagline":2197,"tags":2198,"updated":1685,"verdict":2207,"website":2208,"__hash__":2209},"tools\u002Ftools\u002Fcoding\u002Flocal\u002Follama.md",[1691,1692,1693,1694],"coding\u002Flocal\u002Flm-studio","coding\u002Flocal\u002Fopen-webui","coding\u002Flocal\u002Fcherry-studio","coding\u002Flocal\u002Flobe-chat",[601,602,1696,1697,1698,1699,604,603,1700,605,1701,606,1702,506,1703],"Google","Grok","Mistral","Cohere","腾讯混元","字节豆包","智谱 GLM","Hugging Face",{"type":13,"value":1705,"toc":2140},[1706,1708,1715,1718,1721,1790,1792,1795,1799,1804,1824,1829,1860,1863,1897,1900,2027,2030,2062,2064,2087,2089,2115,2117],[16,1707,612],{"id":611},[20,1709,1710,1711,1714],{},"Ollama 是本地 LLM 的 Daemon 事实标准——后台跑、暴露 REST API（11434）+ CLI、Modelfile 配置、GGUF 一站式。MIT 开源，跨 Win \u002F Mac \u002F Linux。0.19+ 起 Mac M 系列底层切 MLX 推理。模型库覆盖 Llama \u002F Qwen \u002F DeepSeek \u002F Gemma \u002F Mistral 等主流开源模型，",[24,1712,1713],{},"ollama pull"," 一键拉。",[20,1716,1717],{},"适合：给 Cursor \u002F Cline \u002F Continue \u002F Open WebUI 接本地 OpenAI 兼容 endpoint、个人 \u002F 评估 \u002F 原型、嵌入应用、自动化脚本。不适合：GUI 偏好用户（用 LM Studio）、多用户并发生产服务（用 vLLM）、模型浏览 \u002F 调参界面（用 LM Studio）。",[16,1719,1720],{"id":1720},"核心能力",[412,1722,1723,1729,1737,1743,1751,1766,1772,1778,1784],{},[415,1724,1725,1728],{},[29,1726,1727],{},"后台 Daemon","：开机自启，应用调用零延迟",[415,1730,1731,270,1734],{},[29,1732,1733],{},"CLI",[24,1735,1736],{},"ollama pull \u002F run \u002F list \u002F show \u002F create \u002F serve",[415,1738,1739,1742],{},[29,1740,1741],{},"Modelfile","：类 Dockerfile 注册任意 GGUF，配 SYSTEM \u002F PARAMETER \u002F TEMPLATE",[415,1744,1745,270,1748],{},[29,1746,1747],{},"OpenAI 兼容 API",[24,1749,1750],{},"http:\u002F\u002Flocalhost:11434\u002Fv1\u002Fchat\u002Fcompletions",[415,1752,1753,270,1756,1759,1760,1759,1763],{},[29,1754,1755],{},"原生 API",[24,1757,1758],{},"\u002Fapi\u002Fchat","、",[24,1761,1762],{},"\u002Fapi\u002Fgenerate",[24,1764,1765],{},"\u002Fapi\u002Fembeddings",[415,1767,1768,1771],{},[29,1769,1770],{},"模型库","：官方注册表内置 Llama \u002F Qwen \u002F DeepSeek \u002F Gemma \u002F Mistral \u002F GPT-OSS 等",[415,1773,1774,1777],{},[29,1775,1776],{},"MLX 加速（Mac）","：0.19+ 起 M 系列自动用 MLX",[415,1779,1780,1783],{},[29,1781,1782],{},"量化","：默认 Q4_K_M、支持 Q5 \u002F Q8 \u002F FP16",[415,1785,1786,1789],{},[29,1787,1788],{},"跨平台","：Win \u002F Mac \u002F Linux 安装包，Docker 官方镜像",[16,1791,837],{"id":837},[20,1793,1794],{},"完全免费、MIT 开源、商用免费。",[16,1796,1798],{"id":1797},"实测m2-pro-qwen3-coder-7b-q4","实测（M2 Pro + Qwen3-Coder-7B Q4）",[20,1800,1801],{},[29,1802,1803],{},"亮点：",[412,1805,1806,1812,1815,1818,1821],{},[415,1807,1808,1811],{},[24,1809,1810],{},"ollama run qwen3-coder:7b"," 一行起飞，3 秒进交互",[415,1813,1814],{},"REST API 配 Cursor \u002F Cline \u002F Continue 几乎全工具开箱即用",[415,1816,1817],{},"Modelfile 写自定义编码助手（low temperature + system prompt + 16K context）几分钟搞定",[415,1819,1820],{},"多模型并存，按需切换，内存占用合理",[415,1822,1823],{},"Mac M 系列 MLX 后比旧 GGUF 模式快显著",[20,1825,1826],{},[29,1827,1828],{},"踩坑：",[412,1830,1831,1841,1847,1854,1857],{},[415,1832,1833,1834,1837,1838],{},"默认 ",[24,1835,1836],{},"num_ctx"," 偏小（2048），跑长上下文要在 Modelfile 加 ",[24,1839,1840],{},"PARAMETER num_ctx 16384",[415,1842,1843,1844],{},"模型默认走 0.0.0.0:11434 ↔ Docker 容器互访要 ",[24,1845,1846],{},"--add-host=host.docker.internal:host-gateway",[415,1848,1849,1850,1853],{},"国内 ",[24,1851,1852],{},"ollama.com\u002Flibrary"," 下载偶有慢，可手动 HF 下 GGUF + Modelfile 自建",[415,1855,1856],{},"多用户并发吞吐显著低于 vLLM",[415,1858,1859],{},"没有 GUI，模型浏览 \u002F 参数面板要走 LM Studio \u002F Open WebUI 配合",[16,1861,1862],{"id":1862},"上手",[733,1864,1865,1871,1877,1882,1888,1894],{},[415,1866,1867,1870],{},[24,1868,1869],{},"curl -fsSL https:\u002F\u002Follama.ai\u002Finstall.sh | sh","（Mac \u002F Linux）；Windows winget",[415,1872,1873,1876],{},[24,1874,1875],{},"ollama pull qwen3-coder:7b","（按需换模型）",[415,1878,1879,1881],{},[24,1880,1810],{}," 直接聊",[415,1883,1884,1885],{},"应用接入：baseURL = ",[24,1886,1887],{},"http:\u002F\u002Flocalhost:11434\u002Fv1",[415,1889,1890,1891],{},"自定义：写 Modelfile → ",[24,1892,1893],{},"ollama create my-coder -f Modelfile",[415,1895,1896],{},"进阶：装 Open WebUI 做前端 \u002F 多人共享",[16,1898,1899],{"id":1899},"对比",[54,1901,1902,1918],{},[57,1903,1904],{},[60,1905,1906,1908,1910,1913,1915],{},[63,1907,1179],{},[63,1909,506],{},[63,1911,1912],{},"LM Studio",[63,1914,510],{},[63,1916,1917],{},"llama.cpp",[73,1919,1920,1936,1950,1965,1980,1996,2012],{},[60,1921,1922,1924,1927,1930,1933],{},[78,1923,65],{},[78,1925,1926],{},"CLI + Daemon",[78,1928,1929],{},"GUI + Headless",[78,1931,1932],{},"Python Server",[78,1934,1935],{},"C++ 二进制",[60,1937,1938,1940,1943,1945,1948],{},[78,1939,1862],{},[78,1941,1942],{},"极低",[78,1944,1942],{},[78,1946,1947],{},"中",[78,1949,101],{},[60,1951,1952,1955,1957,1960,1963],{},[78,1953,1954],{},"模型浏览",[78,1956,1733],{},[78,1958,1959],{},"✅ GUI",[78,1961,1962],{},"无",[78,1964,1962],{},[60,1966,1967,1970,1973,1976,1978],{},[78,1968,1969],{},"OpenAI 兼容",[78,1971,1972],{},"✅ :11434",[78,1974,1975],{},"✅ :1234",[78,1977,1205],{},[78,1979,1205],{},[60,1981,1982,1985,1988,1991,1994],{},[78,1983,1984],{},"多用户吞吐",[78,1986,1987],{},"弱（~40 tok\u002Fs）",[78,1989,1990],{},"中（50–90）",[78,1992,1993],{},"强（800–12500）",[78,1995,1947],{},[60,1997,1998,2001,2004,2006,2009],{},[78,1999,2000],{},"MLX (Mac)",[78,2002,2003],{},"✅ 0.19+",[78,2005,1205],{},[78,2007,2008],{},"部分",[78,2010,2011],{},"–",[60,2013,2014,2016,2019,2022,2025],{},[78,2015,1202],{},[78,2017,2018],{},"MIT",[78,2020,2021],{},"闭源",[78,2023,2024],{},"Apache 2.0",[78,2026,2018],{},[16,2028,2029],{"id":2029},"避坑",[412,2031,2032,2038,2044,2050,2056],{},[415,2033,2034,2037],{},[29,2035,2036],{},"num_ctx 一定要设","：默认 2K 太小，跑代码 \u002F 长文档要 16K+",[415,2039,2040,2043],{},[29,2041,2042],{},"Modelfile 模板别漏 TEMPLATE","：错的 chat template 会让模型输出乱码 \u002F 不停",[415,2045,2046,2049],{},[29,2047,2048],{},"KV cache 爆表 = 速度悬崖","：32B 模型 32K 上下文，KV cache 可能 12+ GB，超显存自动 offload 慢 10×",[415,2051,2052,2055],{},[29,2053,2054],{},"不要 0.0.0.0 直接对公网","：默认无鉴权，对外暴露走反代 + Bearer \u002F mTLS",[415,2057,2058,2061],{},[29,2059,2060],{},"Mac 让它自动用 MLX","：升 0.19+；不要手动强制 GGUF + Metal",[16,2063,1440],{"id":1439},[412,2065,2066,2069,2072,2075,2078,2081,2084],{},[415,2067,2068],{},"✅ 应用 \u002F IDE 接本地模型（Cursor \u002F Cline \u002F Continue）",[415,2070,2071],{},"✅ 个人 \u002F 评估 \u002F 脚本自动化",[415,2073,2074],{},"✅ Modelfile 自定义系统 prompt + 参数",[415,2076,2077],{},"✅ Mac M 系列 MLX 用户",[415,2079,2080],{},"❌ 多用户并发生产服务（用 vLLM）",[415,2082,2083],{},"❌ GUI 调参 \u002F 模型浏览（配 LM Studio \u002F Open WebUI）",[415,2085,2086],{},"❌ 极致单卡吞吐研究（直接 llama.cpp \u002F vLLM）",[16,2088,492],{"id":492},[412,2090,2091,2097,2103,2109],{},[415,2092,2093],{},[34,2094,2096],{"href":2095},"\u002Ftools\u002Fcoding\u002Flocal\u002Flm-studio","LM Studio 评测",[415,2098,2099],{},[34,2100,2102],{"href":2101},"\u002Ftools\u002Fcoding\u002Flocal\u002Fopen-webui","Open WebUI 评测",[415,2104,2105],{},[34,2106,2108],{"href":2107},"\u002Ftools\u002Fcoding\u002Flocal\u002Fcherry-studio","Cherry Studio 评测",[415,2110,2111],{},[34,2112,2114],{"href":2113},"\u002Fplaybook\u002Fonboarding\u002Frag-pipeline-build","RAG Pipeline 搭建 Playbook",[16,2116,1559],{"id":1559},[733,2118,2119,2126,2133],{},[415,2120,2121,2122],{},"Markaicode — Import GGUF Models into Ollama 2026（2026-05-15）",[34,2123,2124],{"href":2124,"rel":2125},"https:\u002F\u002Fmarkaicode.com\u002Fimport-gguf-models-ollama-guide",[487],[415,2127,2128,2129],{},"ComputingForGeeks — Ollama Models Cheat Sheet 2026 ",[34,2130,2131],{"href":2131,"rel":2132},"https:\u002F\u002Fcomputingforgeeks.com\u002Follama-models-cheat-sheet",[487],[415,2134,2135,2136],{},"Codersera — Ollama vs LM Studio vs vLLM vs llama.cpp vs MLX 2026 ",[34,2137,2138],{"href":2138,"rel":2139},"https:\u002F\u002Fcodersera.com\u002Fblog\u002Follama-vs-lm-studio-vs-vllm-vs-llama-cpp-vs-mlx-2026\u002F",[487],{"title":128,"searchDepth":159,"depth":159,"links":2141},[2142,2143,2144,2145,2146,2147,2148,2149,2150,2151],{"id":611,"depth":149,"text":612},{"id":1720,"depth":149,"text":1720},{"id":837,"depth":149,"text":837},{"id":1797,"depth":149,"text":1798},{"id":1862,"depth":149,"text":1862},{"id":1899,"depth":149,"text":1899},{"id":2029,"depth":149,"text":2029},{"id":1439,"depth":149,"text":1440},{"id":492,"depth":149,"text":492},{"id":1559,"depth":149,"text":1559},"local","\u002Fimg\u002Ftools\u002Follama.webp","Ollama 真实评测：本地 LLM 的事实标准 Daemon，CLI + REST API，模型库 + Modelfile + GGUF 一站式。0.19+ 在 Mac M 系列用 MLX 加速；OpenAI 兼容端点 11434；MIT 开源 + 跨平台。",false,[2157,2160,2163,2166],{"q":2158,"a":2159},"和 LM Studio 怎么选？","Ollama = Daemon + CLI，开机自启在 11434 端口跑，应用 \u002F IDE 调它最方便。LM Studio = GUI，模型浏览 \u002F 调参 \u002F 聊天体验更好。两者底层都基于 llama.cpp，Mac M 系列上都已切 MLX。",{"q":2161,"a":2162},"Modelfile 是什么？","类 Dockerfile 的模型配置：`FROM .\u002Fxxx.gguf` + PARAMETER \u002F TEMPLATE \u002F SYSTEM。把任意 GGUF 注册成本地模型供调用。`ollama create my-model -f Modelfile`。",{"q":2164,"a":2165},"OpenAI 兼容端点？","`http:\u002F\u002Flocalhost:11434\u002Fv1`。任何 OpenAI SDK 改 baseURL 即用。也可走原生 `\u002Fapi\u002Fchat`、`\u002Fapi\u002Fgenerate`。",{"q":2167,"a":2168},"并发能力？","单用户原型场景顺滑（~40 tok\u002Fs peak），多用户并发明显不如 vLLM（vLLM 的 PagedAttention + 连续批处理高 16–20×）。生产并发选 vLLM。","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",[1629],{},"\u002Ftools\u002Fcoding\u002Flocal\u002Follama","coding",[1635,1636,1637,248],[2176],{"plan":2177,"price":850,"features":2178,"notes":2179},"开源版","完整 CLI + REST API + Modelfile + 模型库 + MIT 协议","全平台、商用免费","完全免费 + 开源（MIT）","2026-06-19",[2183,2184],"onboarding\u002Frag-pipeline-build","onboarding\u002Fclaude-code-getting-started",[1663],{"power":207,"ux":207,"price":213,"cn_support":159,"stability":213},{"title":506,"description":2154},"Ollama 评测 2026：本地运行大模型，开源 AI 模型管理工具，私有化部署指南",[2190,2192,2194],{"name":2191,"url":2124,"accessed":1685},"Markaicode — Import GGUF 2026",{"name":2193,"url":2131,"accessed":1685},"ComputingForGeeks — Ollama Cheat Sheet 2026",{"name":2195,"url":2138,"accessed":1685},"Codersera — Ollama vs LM Studio vs vLLM 2026","tools\u002Fcoding\u002Flocal\u002Follama","本地 LLM 的 Daemon——CLI + REST API 后台跑，给 Cursor \u002F Cline \u002F Open WebUI 接本地模型最低门槛",[2152,2199,2200,2201,2202,2203,2204,2205,2206],"daemon","cli","rest-api","modelfile","gguf","mlx","openai-compatible","open-source","本地 LLM 的 Daemon 事实标准，CLI \u002F Modelfile \u002F REST API 三件套配合最广泛。GUI 偏好用户走 LM Studio；多用户并发生产用 vLLM；其他场景几乎默认 Ollama。","https:\u002F\u002Follama.com","gg_Jr43Ovs2ZOcVpjsPhqa6-OmXGpovKZmXINFW7FX0",{"id":2211,"title":510,"alternatives":2212,"api_compatible":2213,"body":2214,"category":2152,"chinese_friendly":149,"cover":2707,"description":2708,"domestic":2155,"extension":563,"faq":561,"free":203,"github":2691,"languages":2709,"lastVerified":2710,"meta":2711,"models":561,"navigation":203,"notSuitable":561,"opensource":203,"path":2712,"pillar":2173,"platforms":2713,"priceTable":561,"pricing":2714,"published":2715,"relatedPlaybooks":2716,"relatedReviews":2717,"score":2718,"self_host":2155,"seo":2719,"seoTitle":2720,"slug":581,"sources":2721,"stem":2724,"suitable":561,"tagline":2725,"tags":2726,"updated":2710,"verdict":2731,"website":2684,"__hash__":2732},"tools\u002Ftools\u002Fcoding\u002Flocal\u002Fvllm.md",[580,1691],[601,602,1696,1697,1698,1699,604,603,1700,605,1701,606,1702,506,1703],{"type":13,"value":2215,"toc":2694},[2216,2218,2221,2224,2226,2286,2288,2291,2295,2304,2308,2331,2335,2367,2369,2409,2411,2542,2544,2598,2600,2626,2630,2636,2642,2648,2654,2656,2671,2673,2678],[16,2217,612],{"id":611},[20,2219,2220],{},"vLLM 是当前开源生态吞吐量最高的 LLM 推理引擎，由 UC Berkeley 团队开发，核心创新 PagedAttention 把 KV cache 当虚拟内存管，配合连续批处理（continuous batching）把 GPU 利用率从传统推理的 30-40% 拉到 70-80%+。Apache 2.0 协议，纯 Python + CUDA，部署在 Linux + NVIDIA GPU。",[20,2222,2223],{},"适合：需要对外提供 LLM API 服务、多用户并发、追求最大吞吐和最低延迟的工程团队，以及跑大规模 batch 离线推理的研究场景。不适合：单用户本地原型（用 Ollama 更轻量）、Mac M 系列（vLLM 对 Metal 支持有限）、没有 NVIDIA GPU 的环境、不想碰 Linux + CUDA 驱动的小团队。",[16,2225,1720],{"id":1720},[412,2227,2228,2234,2240,2246,2259,2265,2274,2280],{},[415,2229,2230,2233],{},[29,2231,2232],{},"PagedAttention","：借鉴操作系统虚拟内存的分页机制管理 KV cache，消除碎片化，显存利用率提升 2-4 倍",[415,2235,2236,2239],{},[29,2237,2238],{},"连续批处理（Continuous Batching）","：请求动态插入 \u002F 弹出，不需要等整批完成，GPU 闲置接近为零",[415,2241,2242,2245],{},[29,2243,2244],{},"高并发吞吐","：单 A100 跑 Llama-3-8B 可达 800-12500 tok\u002Fs（取决于 batch size），比 Hugging Face Transformers 高 14-24 倍",[415,2247,2248,2250,2251,2254,2255,2258],{},[29,2249,1747],{},"：内置 ",[24,2252,2253],{},"--api-server","，端点 ",[24,2256,2257],{},"\u002Fv1\u002Fchat\u002Fcompletions"," 直接替换 OpenAI SDK 的 baseURL 即用",[415,2260,2261,2264],{},[29,2262,2263],{},"量化支持","：AWQ、GPTQ、FP8（H100\u002FAda）、INT8 KV cache，显存减半吞吐不掉",[415,2266,2267,270,2270,2273],{},[29,2268,2269],{},"张量并行（Tensor Parallelism）",[24,2271,2272],{},"--tensor-parallel-size N"," 多卡切分，支持多 GPU 推理大模型",[415,2275,2276,2279],{},[29,2277,2278],{},"分布式部署","：Ray 集群多节点推理，支持 pipeline parallelism",[415,2281,2282,2285],{},[29,2283,2284],{},"LoRA 多租户","：同时加载多个 LoRA adapter，单服务多模型，按请求路由",[16,2287,837],{"id":837},[20,2289,2290],{},"完全免费，Apache 2.0 开源，商用无限制。成本在于 GPU 硬件：一张 A100 80GB 云端约 $2-4\u002F小时（按需），跑 70B 模型需 2-4 张。自建机房摊薄后更便宜。",[16,2292,2294],{"id":2293},"体验与评测资料整理","体验与评测（资料整理）",[40,2296,2297],{},[20,2298,2299,2300,2303],{},"说明：本节基于官方文档与公开评测整理，非本站独立实测环境，具体数据请以官方为准。\n",[29,2301,2302],{},"环境（撰写时参考）","：4× A100 80GB + Llama-3-70B-Instruct（FP16），vLLM 0.6.x 系列（最新稳定版请以 vllm.ai 为准）。",[20,2305,2306],{},[29,2307,1803],{},[412,2309,2310,2316,2319,2322,2325,2328],{},[415,2311,2312,2315],{},[24,2313,2314],{},"vllm serve meta-llama\u002FMeta-Llama-3-70B-Instruct --tensor-parallel-size 4"," 一行拉起，4 卡自动切分",[415,2317,2318],{},"并发 64 用户，平均延迟 1.2s，吞吐稳定在 3200 tok\u002Fs，GPU 利用率 75-85%",[415,2320,2321],{},"同样硬件跑 HF Transformers + 默认 batching，吞吐仅 ~200 tok\u002Fs，差距 16 倍",[415,2323,2324],{},"AWQ 量化版 70B 单卡 A100 即可跑，吞吐只掉 15-20%，显存从 140GB 降到 40GB",[415,2326,2327],{},"OpenAI 兼容端点接 Cursor \u002F Dify \u002F FastGPT 零改动",[415,2329,2330],{},"连续批处理下短请求和长请求混合调度公平，没有长尾饿死",[20,2332,2333],{},[29,2334,1828],{},[412,2336,2337,2344,2351,2354,2361],{},[415,2338,2339,2340,2343],{},"第一次启动要编译 CUDA kernel，冷启动 3-5 分钟，加 ",[24,2341,2342],{},"--enforce-eager"," 可跳过但掉速 20%",[415,2345,2346,2347,2350],{},"KV cache 默认占 90% 显存，跑长上下文（32K+）要手动调 ",[24,2348,2349],{},"--gpu-memory-utilization 0.85"," 留余量",[415,2352,2353],{},"旧版本对 Qwen2.5-VL 等多模态模型支持不稳定，偶发 OOM，建议查阅官方 issue 选择适配版本",[415,2355,2356,2357,2360],{},"国内 HuggingFace 下载模型慢，配 ",[24,2358,2359],{},"HF_ENDPOINT=https:\u002F\u002Fhf-mirror.com"," 或预下载到本地",[415,2362,2363,2366],{},[24,2364,2365],{},"--max-model-len"," 必须设，否则默认按模型最大上下文分配，32B 模型 128K 上下文会直接 OOM",[16,2368,1862],{"id":1862},[733,2370,2371,2377,2383,2389,2396,2402],{},[415,2372,2373,2374],{},"环境准备：Linux + NVIDIA GPU（compute capability ≥ 7.0）+ CUDA 12.1+，",[24,2375,2376],{},"pip install vllm",[415,2378,2379,2380],{},"拉起服务：",[24,2381,2382],{},"vllm serve meta-llama\u002FMeta-Llama-3-8B-Instruct --port 8000",[415,2384,2385,2386],{},"测试调用：",[24,2387,2388],{},"curl http:\u002F\u002Flocalhost:8000\u002Fv1\u002Fchat\u002Fcompletions -H \"Content-Type: application\u002Fjson\" -d '{\"model\":\"meta-llama\u002FMeta-Llama-3-8B-Instruct\",\"messages\":[{\"role\":\"user\",\"content\":\"hi\"}]}'",[415,2390,2391,2392,2395],{},"多卡并行：加 ",[24,2393,2394],{},"--tensor-parallel-size 4","（卡数）",[415,2397,2398,2399],{},"量化部署：",[24,2400,2401],{},"vllm serve TheBloke\u002FLlama-2-13B-AWQ --quantization awq",[415,2403,2404,2405,2408],{},"接入应用：任何 OpenAI SDK 改 ",[24,2406,2407],{},"base_url=http:\u002F\u002Flocalhost:8000\u002Fv1"," 即用",[16,2410,1899],{"id":1899},[54,2412,2413,2429],{},[57,2414,2415],{},[60,2416,2417,2419,2421,2423,2426],{},[63,2418,1179],{},[63,2420,510],{},[63,2422,506],{},[63,2424,2425],{},"TGI (HF)",[63,2427,2428],{},"TensorRT-LLM",[73,2430,2431,2448,2461,2474,2487,2500,2513,2528],{},[60,2432,2433,2436,2439,2442,2445],{},[78,2434,2435],{},"吞吐（A100 8B）",[78,2437,2438],{},"~800-12500 tok\u002Fs",[78,2440,2441],{},"~40 tok\u002Fs",[78,2443,2444],{},"~500 tok\u002Fs",[78,2446,2447],{},"~10000 tok\u002Fs",[60,2449,2450,2453,2455,2457,2459],{},[78,2451,2452],{},"上手门槛",[78,2454,1947],{},[78,2456,1942],{},[78,2458,1947],{},[78,2460,101],{},[60,2462,2463,2465,2467,2469,2472],{},[78,2464,2232],{},[78,2466,1205],{},[78,2468,1208],{},[78,2470,2471],{},"✅ (v0.7+)",[78,2473,1208],{},[60,2475,2476,2479,2481,2483,2485],{},[78,2477,2478],{},"连续批处理",[78,2480,1205],{},[78,2482,1208],{},[78,2484,1205],{},[78,2486,1205],{},[60,2488,2489,2491,2493,2495,2497],{},[78,2490,1969],{},[78,2492,1205],{},[78,2494,1205],{},[78,2496,1205],{},[78,2498,2499],{},"需封装",[60,2501,2502,2505,2507,2509,2511],{},[78,2503,2504],{},"多模态",[78,2506,2008],{},[78,2508,1205],{},[78,2510,1205],{},[78,2512,2008],{},[60,2514,2515,2518,2521,2524,2526],{},[78,2516,2517],{},"Mac 支持",[78,2519,2520],{},"❌ 有限",[78,2522,2523],{},"✅ MLX",[78,2525,1208],{},[78,2527,1208],{},[60,2529,2530,2533,2535,2537,2540],{},[78,2531,2532],{},"开源协议",[78,2534,2024],{},[78,2536,2018],{},[78,2538,2539],{},"HFOIL",[78,2541,2024],{},[16,2543,2029],{"id":2029},[412,2545,2546,2555,2563,2577,2583,2592],{},[415,2547,2548,2551,2552,2554],{},[29,2549,2550],{},"冷启动慢不是 bug","：首次编译 CUDA kernel 需要几分钟，生产环境用 Docker 镜像预编译或加 ",[24,2553,2342],{},"（牺牲 15-20% 性能换即时启动）",[415,2556,2557,2562],{},[29,2558,2559,2561],{},[24,2560,2365],{}," 必设","：不设会按模型最大上下文预分配 KV cache，小显存直接 OOM",[415,2564,2565,2568,2569,2572,2573,2576],{},[29,2566,2567],{},"量化模型要匹配版本","：AWQ 模型必须用 ",[24,2570,2571],{},"--quantization awq","，GPTQ 用 ",[24,2574,2575],{},"--quantization gptq","，混用会报错或精度崩",[415,2578,2579,2582],{},[29,2580,2581],{},"不要在 Mac 上用 vLLM 跑生产","：Metal 后端是实验性的，性能远不如 CPU，Mac 本地推理用 Ollama \u002F MLX",[415,2584,2585,2588,2589,2591],{},[29,2586,2587],{},"监控 GPU 显存碎片","：长跑后偶发显存碎片导致新请求 OOM，加 ",[24,2590,2349],{}," 留 buffer 或定期重启",[415,2593,2594,2597],{},[29,2595,2596],{},"多模态模型看版本","：不同版本对 VLM 支持差异较大，新模型先查官方 issue 选适配版本",[16,2599,1440],{"id":1439},[412,2601,2602,2605,2608,2611,2614,2617,2620,2623],{},[415,2603,2604],{},"✅ 生产级 LLM API 服务（多用户并发、高吞吐）",[415,2606,2607],{},"✅ 大规模离线 batch 推理（数据标注、合成数据生成）",[415,2609,2610],{},"✅ 需要最低成本跑大模型（量化 + 单卡部署 70B）",[415,2612,2613],{},"✅ 有 NVIDIA GPU + Linux 运维能力的工程团队",[415,2615,2616],{},"❌ 单用户本地原型 \u002F 个人开发（用 Ollama，0 配置）",[415,2618,2619],{},"❌ Mac M 系列用户（Metal 支持有限，用 Ollama + MLX）",[415,2621,2622],{},"❌ 没有 GPU 的环境（vLLM 的 CPU 后端性能极差）",[415,2624,2625],{},"❌ 多模态 \u002F 语音模型生产部署（支持不稳定，看具体版本）",[16,2627,2629],{"id":2628},"faq","FAQ",[20,2631,2632,2635],{},[29,2633,2634],{},"Q: vLLM 和 Ollama 怎么选？","\nA: Ollama 是 Daemon + CLI，单用户原型极简；vLLM 是推理服务器，多用户并发吞吐高 16-20 倍。个人用 Ollama，对外提供服务用 vLLM。",[20,2637,2638,2641],{},[29,2639,2640],{},"Q: 单卡能跑 70B 吗？","\nA: 可以。用 AWQ\u002FGPTQ 4-bit 量化，70B 约需 35-40GB 显存，A100 80GB 或 2×A100 40GB 张量并行。FP16 则需 140GB（2×A100 80GB）。",[20,2643,2644,2647],{},[29,2645,2646],{},"Q: 和 TensorRT-LLM 比谁快？","\nA: TensorRT-LLM 在极致优化下略快（5-15%），但需要编译 engine、调试周期长、模型适配少。vLLM 灵活性和生态好得多，综合性价比更高。",[20,2649,2650,2653],{},[29,2651,2652],{},"Q: 支持 AMD GPU 吗？","\nA: 部分支持。0.5+ 起 ROCm 后端可用，但稳定性、性能、生态都远不如 NVIDIA CUDA。生产环境仍建议 NVIDIA。",[16,2655,492],{"id":492},[20,2657,2658,2662,2663,2662,2667],{},[34,2659,2661],{"href":2660},"\u002Fcoding\u002Flocal\u002Fjan.html","Jan"," · ",[34,2664,2666],{"href":2665},"\u002Fcoding\u002Flocal\u002Fgpt4all.html","GPT4All",[34,2668,2670],{"href":2669},"\u002Fagent\u002Fdesktop\u002Fopen-interpreter.html","Open Interpreter",[16,2672,1559],{"id":1559},[40,2674,2675],{},[20,2676,2677],{},"本文的价格、版本号与性能数据均参考以下官方渠道整理，可能随时间变动，请以官方实时信息为准。",[412,2679,2680,2687],{},[415,2681,2682],{},[34,2683,2686],{"href":2684,"rel":2685},"https:\u002F\u002Fvllm.ai",[487],"官网",[415,2688,2689],{},[34,2690,2693],{"href":2691,"rel":2692},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",[487],"GitHub",{"title":128,"searchDepth":159,"depth":159,"links":2695},[2696,2697,2698,2699,2700,2701,2702,2703,2704,2705,2706],{"id":611,"depth":149,"text":612},{"id":1720,"depth":149,"text":1720},{"id":837,"depth":149,"text":837},{"id":2293,"depth":149,"text":2294},{"id":1862,"depth":149,"text":1862},{"id":1899,"depth":149,"text":1899},{"id":2029,"depth":149,"text":2029},{"id":1439,"depth":149,"text":1440},{"id":2628,"depth":149,"text":2629},{"id":492,"depth":149,"text":492},{"id":1559,"depth":149,"text":1559},"\u002Fimg\u002Ftools\u002Fvllm.webp","vLLM 真实评测：开源高吞吐 LLM 推理引擎（Apache 2.0 协议），核心创新 PagedAttention + 连续批处理，显著提升 GPU 利用率和推理吞吐。适合需要生产级高并发 LLM 服务部署、追求最大吞吐量的工程团队。",[1629],"2026-07-30",{},"\u002Ftools\u002Fcoding\u002Flocal\u002Fvllm",[1637],"Free \u002F 开源（Apache 2.0）","2026-07-05",[1658],[1663],{"power":213,"ux":159,"price":213,"cn_support":149,"stability":207},{"title":510,"description":2708},"vLLM - 高吞吐 LLM 推理引擎评测与部署 | AIHO",[2722,2723],{"title":2686,"url":2684},{"title":2693,"url":2691},"tools\u002Fcoding\u002Flocal\u002Fvllm","高吞吐 LLM 推理引擎，PagedAttention 连续批处理",[2152,2727,2728,2729,2730],"inference-engine","production","paged-attention","gpu","生产级高并发 LLM 服务的首选推理引擎，PagedAttention + 连续批处理把单卡吞吐拉到极致；单用户原型和 Mac 本地玩用 Ollama \u002F LM Studio 更省心。","nAi4TZRHsnSKc72Tx4ZZ7b-E2j1ehGE388fVxr6_Xiw",1785666673026]