DeepSeek V4 发布:1.6T 参数 + 1M 上下文,混合价击穿行业底价
2026-06-27 · DeepSeek
要点
- 代号 "DSpark",分 V4-Pro 与 V4-Flash 两档
- V4-Pro:1.6T 参数、1M 上下文,reasoning 档定价约 $1.74/$3.48;混合价约 $0.18/M(业界最低档之一)
- V4-Flash:$0.14/$0.28,1M 上下文,主打超低价、高吞吐
- 定位高并发、低延迟在线服务场景
价格战的新地板
如果说 2026 上半年前沿模型的主题是"跑分内卷",那 DeepSeek V4 把叙事拉回了成本。V4-Flash 的 $0.14/$0.28 定价,让大规模 Agent 任务、批量数据处理、在线客服等高频调用场景的账单再降一个数量级。
| 档位 | Input(每 1M) | Output(每 1M) | 上下文 |
|---|---|---|---|
| V4-Pro | ~$1.74 | ~$3.48 | 1M |
| V4-Flash | $0.14 | $0.28 | 1M |
| 对比 GPT-5.6 Sol | $5 | $30 | 1.1M |
背景上下文
DeepSeek 自 2025 年初凭借 V3 的极致性价比一战成名,此后便牢牢占据"行业价格锚"的位置。2026 年上半年,随着 GPT-5.6、Claude Sonnet 5、Kimi K3 等前沿模型密集发布,整个行业把焦点放在了基准分数与上下文长度的比拼上,单 token 价格一度被忽视。但企业落地侧的真实反馈始终是:跑分不能当饭吃,token 账单才是采用 AI 的最大阻力。
V4 的发布时间点选得很有讲究——恰逢 GPT-5.6 家族全量 GA 后不到一个月,多数团队还在为"选 Sol 还是 Terra"做预算评估。DeepSeek 此时抛出 Flash 档,直接把"够用的智能"压到 $0.14/$0.28,等于在 OpenAI 的分层定价体系下方又铺了一层地板。这延续了中国团队一贯的"价格屠夫"打法,也说明 DeepSeek 在 MoE 训练与推理优化上已形成稳定迭代节奏。
技术细节
V4 延续了 DeepSeek 的 MoE(混合专家)路线,但相比 V3 有几处关键升级:
- 1.6T 总参数 / 极低激活比例:Pro 档总参 1.6T,单次推理激活参数控制在百亿量级,这让"大模型 + 低延迟"成为可能。Flash 档进一步压缩激活,换取更高的并发吞吐。
- 1M 上下文窗口:Pro 与 Flash 均支持 100 万 token 上下文,采用改进的 RoPE 扩展与稀疏注意力,长文档场景的 KV cache 占用较 V3 下降约 40%。
- reasoning 可切换:Pro 档可在标准模式与 reasoning 模式间切换。reasoning 模式下单价上浮,但复杂推理任务的质量显著提升;标准模式则主打速度。
- 混合定价机制:DeepSeek 首次公开"混合价"概念——即标准调用与 reasoning 调用按实际使用比例加权后的有效单价。Pro 混合价约 $0.18/M,这是企业做容量规划时最该参考的数字。
行业影响
V4-Flash 的定价对几个细分市场冲击尤为明显:
- 在线客服与 RAG 检索:这类场景对推理深度要求不高,但对延迟和单价极度敏感。Flash 的 $0.14 输入价意味着处理一份 10 万 token 的检索上下文只需约 1.4 美分,几乎可以忽略不计。
- 批量数据处理:合同抽取、日志分析、舆情标注等批处理任务,过去受限于 API 成本只能抽样处理,现在可以全量跑。
- AI Agent 的高频调度:Agent 框架(如 LangGraph、CrewAI)在规划与工具调用阶段会产生大量"琐碎"对话,这些对话不需要旗舰模型——Flash 正好填这个位。
- 国产工具链闭环:V4 + 国产推理框架(如 vLLM、SGLang 的国产适配版)+ 国产云算力,构成当下性价比最高的"纯国产"组合,对数据合规要求高的政企客户尤其有吸引力。
需要指出的是,V4 在绝对能力上仍与 GPT-5.6 Sol、Claude Opus 4.8 存在差距,尤其在多步推理与复杂代码生成上。它的杀手锏是在"够用"这条线上把价格做到无人能及。
谁该用它
- 高并发在线业务:客服、检索增强、内容审核等对单价极度敏感的场景,Flash 是首选
- 需要深度推理的复杂任务:Pro 档在保持低价的同时提供 reasoning 能力
- 成本受限的初创团队:用 V4 跑 MVP,能把 API 支出压到最低
- Agent 中间层调度:把规划/路由类轻量调用切到 Flash,把真正的重活留给旗舰模型,组合使用成本最优
AI 之家 观点
DeepSeek 再次扮演了"价格锚"的角色。它不追求在每个榜单上都第一,而是把"够用的智能"做到极致便宜——这恰好击中了 2026 年企业采用 AI 的最大阻力:token 账单。对国内团队,V4 + 国产工具链是当下性价比最高的组合之一。
但也要清醒:低价不等于万能。在需要顶级推理或复杂代码生成的场景,V4 仍是"备选"而非"首选"。正确的用法是把它作为成本分层策略的底层——80% 的高频轻量任务交给 Flash,20% 的硬核任务留给旗舰模型,整体账单能降一个量级。