跳到主内容
TOOL · CODING #02/07API 网关 / 中转
V

vLLM

Apache-2.0 开源高吞吐推理引擎——PagedAttention 显存分页 + 连续批处理,一行命令起 OpenAI 兼容服务,吃满 GPU

llm-servinginference-enginepagedattentionopenai-compatibleopensourcebyokgpu
访问官网 GitHub 关注此工具更新
能力
5
易用
4
性价比
5
中文
4
稳定
4
编辑结论 评分方法 综合4.4/ 5

要把开源权重变成「能扛流量的 API 服务」,vLLM 是当前默认答案。配合 LiteLLM 做统一网关 / 配合 Ollama 做本地轻量推理是最常见组合;想要零运维的托管推理走云厂商,想要单卡本机跑小模型走 Ollama。

发布 2026-09-06更新 2026-09-06核实 2026-09-06
01 / 04深度解读

TL;DR

一句话定位:vLLM 是把开源大模型变成「高吞吐、低成本 API 服务」的推理引擎——PagedAttention 管理显存、连续批处理吃满 GPU,一条命令起 OpenAI 兼容服务。 最新动态:2026 年迭代到 v0.28.x,归属 PyTorch Foundation,已支持 NVIDIA / AMD / 昇腾 / 天垓 / TPU 等多硬件。 适合谁:需要把 DeepSeek / Qwen / Kimi / GLM 等权重部署成生产级推理服务的团队。

它到底是个什么

vLLM 是一个高吞吐、显存高效的 LLM 推理与服务引擎,最早由 UC Berkeley 的 Sculptor 实验室提出,现由社区维护并归属 PyTorch Foundation。它不是「模型」,而是「跑模型的运行时」——你给它模型权重,它给你一个能扛并发的 API。

它的两个招牌技术是:

  • PagedAttention:把注意力机制的 KV Cache 像操作系统虚拟内存一样分页管理,显存碎片大幅减少,能塞下更长的上下文、更高的并发。
  • Continuous Batching(连续批处理):不再等一个 batch 全部算完才换下一批,而是来一个请求就动态拼进正在跑的批次,GPU 几乎不空转。

核心能力

  • OpenAI 兼容 Servervllm serve <model> 起一个 /v1 endpoint,客户端几乎不用改代码就能从 OpenAI 切过来。
  • 多硬件后端:NVIDIA CUDA、AMD ROCm、Intel Gaudi、Google TPU、AWS Neuron、Apple Silicon、华为昇腾、寒武纪——一套引擎多硬件跑。
  • 广模型覆盖:DeepSeek V4 / V3、Qwen3.8 / Qwen3、Kimi K3 / K2.7、GLM 5.2、Llama 4、Gemma、Mistral 等开源权重开箱即跑。
  • 量化与投机解码:支持 AWQ / GPTQ / FP8 等量化,以及 speculative decoding 提速首字延迟。
  • 生产特性:张量并行(tensor-parallel)、流水线并行、prefix caching、结构化输出、LoRA 热加载。

价格

档位价格说明
Open Source$0(Apache-2.0)引擎免费,成本只来自你自己的 GPU / 算力
托管推理按云厂商计费用云厂商的 vLLM 托管服务则走对方账单

以下价格为 2026-09-06 查询官网,可能有变动。引擎本身免费,真实成本在 GPU 时长。

真实任务实测(基于公开资料归纳)

本文基于 vLLM 官方文档与公开基准整理,非厂商付费内容,也未做长期一手压测;吞吐数据以官网与各硬件release 说明为准。

  • 吞吐:PagedAttention + 连续批处理让同卡吞吐显著高于朴素 Hugging Face Transformers 推理,社区基准普遍报告数倍提升(具体倍数随模型/硬件/批大小浮动,不在此给单一数字以免误导)。
  • 长上下文:分页 KV Cache 让 32K / 128K / 256K 上下文的服务显存占用更可控,长文档场景优势明显。
  • 多硬件:昇腾 / 天垓 NPU 支持让它成为国产算力自托管推理的常用选项。

上手 5 分钟

# 安装(推荐 uv)
uv pip install vllm --torch-backend auto

# 起一个 OpenAI 兼容服务(以 Qwen3 为例)
vllm serve Qwen/Qwen3-8B --tensor-parallel-size 1

# 客户端用 OpenAI SDK 直连
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY",
)
resp = client.chat.completions.create(
    model="Qwen/Qwen3-8B",
    messages=[{"role": "user", "content": "用一句话解释 PagedAttention"}],
)
print(resp.choices[0].message.content)

同类对比

维度vLLMOllamaLiteLLM
定位生产级推理引擎本机轻量推理LLM 网关(不推理)
吞吐优化连续批处理 + PagedAttention不推理,只路由
形态Server / Docker / K8s桌面 App / CLISDK + Proxy
适合高并发 API 服务个人本地跑模型统一多厂商接口

国内使用注意事项

  • vLLM 原生支持**华为昇腾(Ascend)/ 寒武纪(MLU)**等国产 NPU,是信创 / 国产算力自托管推理的常用底座。
  • 中文模型权重(Qwen / Kimi / GLM / DeepSeek)都在官方支持列表,国内拉权重注意用镜像源加速。
  • 文档以英文为主,中文社区资料丰富但需自行甄别版本。

避坑清单

  1. 别用 :latest 上生产——发版快、偶有破坏性变更,固定到带版本号的 release(如 v0.28.x)。
  2. OOM 先调 --gpu-memory-utilization——默认值偏激进,显存不够就降。
  3. 多卡用 --tensor-parallel-size——不设置会尝试塞进单卡导致加载失败。
  4. 长上下文注意 max-num-seqs / max-model-len——并发和长度同时拉满会爆显存。

适合 / 不适合

把开源模型部署成高并发 API 服务的团队 需要连续批处理把 GPU 利用率吃满的推理场景 多硬件(昇腾 / 天垓 / TPU)自托管推理 只想本机双击跑个小模型聊天——Ollama 更顺手 完全没有 GPU / 不想运维——用云厂商托管推理

相关阅读

来源

本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容;功能与版本以官网为准,欢迎在 反馈邮箱 反馈更新。

02 / 04适合 / 不适合
适合谁
  • · 把开源模型部署成高并发 API 服务的团队
  • · 需要连续批处理把 GPU 利用率吃满的推理场景
  • · 多硬件(昇腾 / 天垓 / TPU / ROCm)自托管推理
不适合谁
  • · 只想本机双击跑个小模型的交互型用户——Ollama 更顺手
  • · 完全没有 GPU / 不想运维的服务端——用云厂商托管推理
03 / 04避坑提醒
NOT FOR · 什么情况下不要选它

不适合只想「本机跑个本地模型聊天」的纯交互用户——那条路用 Ollama 更省心

PITFALLS · 避坑提醒
  • 纯 CLI / Server,没有图形界面,新人要先理解引擎参数(tensor-parallel、GPU memory util)
  • 大模型和长上下文对显存敏感,OOM 时调参门槛不低
  • 发版快、偶有破坏性变更,生产务必固定版本号(如 v0.28.x)而非 :latest
兼容模型

可接入 / 兼容以下大模型 API(在设置中配置 key 即可切换底座):

OpenAI
04 / 04类似工具推荐
Newsletter

关注这个工具的后续更新

订阅 AI 之家 周报,第一时间获取该工具版本更新、定价变动与重新评测结果。