vLLM
Apache-2.0 开源高吞吐推理引擎——PagedAttention 显存分页 + 连续批处理,一行命令起 OpenAI 兼容服务,吃满 GPU
要把开源权重变成「能扛流量的 API 服务」,vLLM 是当前默认答案。配合 LiteLLM 做统一网关 / 配合 Ollama 做本地轻量推理是最常见组合;想要零运维的托管推理走云厂商,想要单卡本机跑小模型走 Ollama。
发布 2026-09-06更新 2026-09-06核实 2026-09-06TL;DR
一句话定位:vLLM 是把开源大模型变成「高吞吐、低成本 API 服务」的推理引擎——PagedAttention 管理显存、连续批处理吃满 GPU,一条命令起 OpenAI 兼容服务。 最新动态:2026 年迭代到 v0.28.x,归属 PyTorch Foundation,已支持 NVIDIA / AMD / 昇腾 / 天垓 / TPU 等多硬件。 适合谁:需要把 DeepSeek / Qwen / Kimi / GLM 等权重部署成生产级推理服务的团队。
它到底是个什么
vLLM 是一个高吞吐、显存高效的 LLM 推理与服务引擎,最早由 UC Berkeley 的 Sculptor 实验室提出,现由社区维护并归属 PyTorch Foundation。它不是「模型」,而是「跑模型的运行时」——你给它模型权重,它给你一个能扛并发的 API。
它的两个招牌技术是:
- PagedAttention:把注意力机制的 KV Cache 像操作系统虚拟内存一样分页管理,显存碎片大幅减少,能塞下更长的上下文、更高的并发。
- Continuous Batching(连续批处理):不再等一个 batch 全部算完才换下一批,而是来一个请求就动态拼进正在跑的批次,GPU 几乎不空转。
核心能力
- OpenAI 兼容 Server:
vllm serve <model>起一个/v1endpoint,客户端几乎不用改代码就能从 OpenAI 切过来。 - 多硬件后端:NVIDIA CUDA、AMD ROCm、Intel Gaudi、Google TPU、AWS Neuron、Apple Silicon、华为昇腾、寒武纪——一套引擎多硬件跑。
- 广模型覆盖:DeepSeek V4 / V3、Qwen3.8 / Qwen3、Kimi K3 / K2.7、GLM 5.2、Llama 4、Gemma、Mistral 等开源权重开箱即跑。
- 量化与投机解码:支持 AWQ / GPTQ / FP8 等量化,以及 speculative decoding 提速首字延迟。
- 生产特性:张量并行(tensor-parallel)、流水线并行、prefix caching、结构化输出、LoRA 热加载。
价格
| 档位 | 价格 | 说明 |
|---|---|---|
| Open Source | $0(Apache-2.0) | 引擎免费,成本只来自你自己的 GPU / 算力 |
| 托管推理 | 按云厂商计费 | 用云厂商的 vLLM 托管服务则走对方账单 |
以下价格为 2026-09-06 查询官网,可能有变动。引擎本身免费,真实成本在 GPU 时长。
真实任务实测(基于公开资料归纳)
本文基于 vLLM 官方文档与公开基准整理,非厂商付费内容,也未做长期一手压测;吞吐数据以官网与各硬件release 说明为准。
- 吞吐:PagedAttention + 连续批处理让同卡吞吐显著高于朴素 Hugging Face Transformers 推理,社区基准普遍报告数倍提升(具体倍数随模型/硬件/批大小浮动,不在此给单一数字以免误导)。
- 长上下文:分页 KV Cache 让 32K / 128K / 256K 上下文的服务显存占用更可控,长文档场景优势明显。
- 多硬件:昇腾 / 天垓 NPU 支持让它成为国产算力自托管推理的常用选项。
上手 5 分钟
# 安装(推荐 uv)
uv pip install vllm --torch-backend auto
# 起一个 OpenAI 兼容服务(以 Qwen3 为例)
vllm serve Qwen/Qwen3-8B --tensor-parallel-size 1
# 客户端用 OpenAI SDK 直连
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="EMPTY",
)
resp = client.chat.completions.create(
model="Qwen/Qwen3-8B",
messages=[{"role": "user", "content": "用一句话解释 PagedAttention"}],
)
print(resp.choices[0].message.content)
同类对比
| 维度 | vLLM | Ollama | LiteLLM |
|---|---|---|---|
| 定位 | 生产级推理引擎 | 本机轻量推理 | LLM 网关(不推理) |
| 吞吐优化 | 连续批处理 + PagedAttention | 中 | 不推理,只路由 |
| 形态 | Server / Docker / K8s | 桌面 App / CLI | SDK + Proxy |
| 适合 | 高并发 API 服务 | 个人本地跑模型 | 统一多厂商接口 |
国内使用注意事项
- vLLM 原生支持**华为昇腾(Ascend)/ 寒武纪(MLU)**等国产 NPU,是信创 / 国产算力自托管推理的常用底座。
- 中文模型权重(Qwen / Kimi / GLM / DeepSeek)都在官方支持列表,国内拉权重注意用镜像源加速。
- 文档以英文为主,中文社区资料丰富但需自行甄别版本。
避坑清单
- 别用
:latest上生产——发版快、偶有破坏性变更,固定到带版本号的 release(如 v0.28.x)。 - OOM 先调
--gpu-memory-utilization——默认值偏激进,显存不够就降。 - 多卡用
--tensor-parallel-size——不设置会尝试塞进单卡导致加载失败。 - 长上下文注意
max-num-seqs/max-model-len——并发和长度同时拉满会爆显存。
适合 / 不适合
把开源模型部署成高并发 API 服务的团队 需要连续批处理把 GPU 利用率吃满的推理场景 多硬件(昇腾 / 天垓 / TPU)自托管推理 只想本机双击跑个小模型聊天——Ollama 更顺手 完全没有 GPU / 不想运维——用云厂商托管推理
相关阅读
- 本地轻量推理:Ollama
- 统一多厂商网关:LiteLLM
- 开源模型底座:DeepSeek-V4 / Qwen3 / Kimi K2.7 Code
- 架构科普:MoE(混合专家) / RAG
- 协议层:MCP
来源
本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容;功能与版本以官网为准,欢迎在 反馈邮箱 反馈更新。
- · 把开源模型部署成高并发 API 服务的团队
- · 需要连续批处理把 GPU 利用率吃满的推理场景
- · 多硬件(昇腾 / 天垓 / TPU / ROCm)自托管推理
- · 只想本机双击跑个小模型的交互型用户——Ollama 更顺手
- · 完全没有 GPU / 不想运维的服务端——用云厂商托管推理
不适合只想「本机跑个本地模型聊天」的纯交互用户——那条路用 Ollama 更省心
- 纯 CLI / Server,没有图形界面,新人要先理解引擎参数(tensor-parallel、GPU memory util)
- 大模型和长上下文对显存敏感,OOM 时调参门槛不低
- 发版快、偶有破坏性变更,生产务必固定版本号(如 v0.28.x)而非 :latest
可接入 / 兼容以下大模型 API(在设置中配置 key 即可切换底座):