跳到主内容
coding深度求索

DeepSeek V4.1-Flash

DeepSeek V4.1-Flash 是深度求索 2026-09-10 发布的 552B MoE 模型,采用 Causal Encoder–Decoder 非对称架构(输入激活 8B / 输出激活 16B),支持 1M 上下文与原生视觉理解,权重以 MIT 许可开源。API 闲时 $0.15/$0.60 每百万 token,并自 2026-09-14 起接管全部 deepseek-v4-pro 请求。

发布 2026-09-14更新 2026-09-14核实 2026-09-14

规格

厂商
深度求索
发布日期
2026/9/10
类型
coding
上下文窗口
1000K tokens
最大输出
384K tokens
定价
API 闲时 $0.15/$0.60 每百万 token,峰值 $0.30/$1.20;缓存命中 $0.003/$0.006 · 权重 MIT 免费自部署
API 兼容
openai, deepseek

基准测试

74.2(V4-Pro 62.7)
DeepSWE v1.1
90.6(V4-Pro 87.9)
Terminal-Bench 2.1
90.9(V4-Pro 92.4)
GPQA Diamond
36.8(V4-Pro 42.7)
HLE
552B MoE(输入 8B / 输出 16B)
参数量 / 激活

优势

  • MIT 许可开源权重,可私有化部署,源码不出境场景友好
  • 闲时 $0.15/$0.60 + 缓存命中 $0.003,长上下文 Agent 跑批成本优势明显
  • 1M 上下文、384K 最大输出,原生支持图片输入
  • KV cache 只需上代 1/4 HBM、1/8 SSD,缓存命中成本大幅下降
  • 编程与终端类基准全面超过自家 V4-Pro(DeepSWE v1.1 74.2 vs 62.7)

不足

  • 纯推理知识类基准回退:HLE 36.8 低于 V4-Pro 的 42.7,GPQA Diamond 90.9 vs 92.4
  • 552B checkpoint 约 510 GB(FP8),自托管门槛从上代 2×H200 抬到约 8 卡节点
  • 官方未公布自部署硬件要求与 tokens/s 数据,容量规划需自行压测
  • 无独立推理档位,深度推理链路仍需搭配前沿模型
  • 峰谷定价需排期:工作日 01:00–04:00、06:00–10:00 UTC 为 2 倍峰值

适用场景

长上下文代码审查与老仓库接手(整库一次喂入)高频 Agent 流水线(检索、规划、工具调用)的成本优化批处理与离线跑批(可排到闲时窗口)合规场景私有化部署(金融 / 政务 / 医疗)

概述

DeepSeek V4.1-Flash 是深度求索于 2026 年 9 月 10 日发布的模型,官方定位为新架构家族中「更小但更强」的一档:552B 参数 MoE,采用新的 Causal Encoder–Decoder 架构——输入侧仅激活 8B 参数、输出侧 16B,用非对称激活把推理成本压下来的同时保留旗舰级能力。

它是当前性价比最锋利的一档国产开源模型:1M 上下文、原生视觉理解、MIT 许可权重,闲时 API 价 $0.15 / $0.60 每百万 token。官方给出的判断是它在性能、费用、速度与总用时上已全面超过自家的 DeepSeek V4-Pro,因此有序下线 V4-Pro北京时间 2026-09-14 12:00 起,所有 deepseek-v4-pro 请求路由到 V4.1-Flash 并按 Flash 单价计费,直到 V4.1-Pro 上线(官方未给日期)。

注意:旧模型 V4-Flash 与 V4-Flash-Vision-Exp 已退役;出于兼容,deepseek-v4-flashdeepseek-v4-flash-vision-exp 两个名字暂路由到 V4.1-Flash。上一代情况见 DeepSeek V4(V4-Pro / V4-Flash)

核心能力

新架构:Causal Encoder–Decoder

非对称激活是这一代的核心设计——输入(prefill)只激活 8B、输出(decode)激活 16B。官方配套的说法是预训练方法更新 + 更大 scale 的 RL 后训练,使其在多个基准上超过自家旗舰 V4-Pro。

长上下文与缓存成本

1M 输入上下文、最大 384K 输出。真正影响账单的是 KV cache 体积:官方称所需 HBM 为上代的 1/4、SSD 存储 1/8。对 Agent 场景意义重大,因为缓存命中费用常常占 Agent 成本的大头,而 Flash 的缓存命中价只有未命中的 1/50。

多模态(原生视觉)

图片输入内置,无需再挂单独的 vision 模型。官方同时提到支持图片 + 文本混合输入。

基准表现(官方公布,非第三方复现)

基准V4.1-FlashV4-Pro解读
DeepSWE v1.174.262.7编程 / PR 级任务大幅领先
Terminal-Bench 2.190.687.9终端 Agent 任务领先
GPQA Diamond90.992.4纯知识推理小幅回退
HLE36.842.7高难推理回退明显

形状很清楚:编程、终端、Agent 自动化类全面提升;纯推理知识类小幅回退。第三方(DataNorth)提醒,HLE 36.8 对 Opus-5.0 的 56.3 是数量级差距,不要把它放在研究助手或强事实问答的位置

获取方式(定价 2026-09 核对)

通道成本适合
官方 API(闲时)输入 $0.15 / 输出 $0.60 每百万 token,缓存命中 $0.003绝大多数在线与批量场景
官方 API(峰值)输入 $0.30 / 输出 $1.20,缓存命中 $0.006无法排期的实时请求
自部署(MIT 权重)硬件成本自担,checkpoint 约 510 GB(FP8),约 8 卡节点起数据不出境 / 合规场景

峰值时段为工作日 01:00–04:0006:00–10:00 UTC(北京时间 09:00–12:00 与 14:00–18:00);其余时间与周末全部为闲时,闲时价格为峰值的一半。峰值价自 2026-09-10 12:00 生效。

API 调用示例

from openai import OpenAI

client = OpenAI(
    api_key="sk-...",
    base_url="https://api.deepseek.com",
)

resp = client.chat.completions.create(
    model="deepseek-flash",   # 官方模型名;旧名 deepseek-v4-pro 自 2026-09-14 起同样路由至此
    messages=[
        {"role": "system", "content": "你是一个代码审查助手。只指出确定的问题,不要猜测。"},
        {"role": "user", "content": "审查以下模块,列出潜在 bug 与重复代码:<粘贴代码>"},
    ],
    max_tokens=8192,
)
print(resp.choices[0].message.content)

缓存命中价与未命中价相差 50 倍,稳定的 system prompt 与工具定义顺序是拿到低价的前提;每次请求动态拼接前缀会直接让缓存失效。

适合 / 不适合

适合

  • 长上下文代码审查、接手陌生老仓库(整库一次喂入,省掉 RAG 切片)
  • 高频 Agent 流水线:检索、规划、工具选择这类会放大 token 差异的场景
  • 可排期的批量任务与离线 eval(挪到闲时窗口直接省一半)
  • 合规要求「源码不出境」的团队(MIT 权重可自部署)

不适合

  • 深度数学 / 长链条推理(HLE 36.8 是明确短板,应上前沿推理模型)
  • 强事实准确性要求的研究助手类应用
  • 硬件资源不足以承载约 510 GB checkpoint 的自部署团队
  • 依赖 deepseek-v4-pro 旧行为且无法接受静默替换的生产链路(需在 09-14 前完成回归评测)

相关阅读

来源

本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容;定价与能力以官网为准,欢迎在 反馈邮箱 反馈更新。

相关对比

Aider vs OpenCode:两个开源终端 Agent,选哪个?2026 对比

Aider 与 OpenCode 2026 选型对比:两者都是开源终端 agent、都支持换模型,但 Aider 以 Git-native 工作流与成熟的多语言支持见长,OpenCode 主打模型无关、本地优先与终端交互体验。从 6 个维度给出明确取舍建议。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

CodeBuddy vs 通义灵码:腾讯与阿里的 AI 编程助手怎么选(2026)

CodeBuddy(腾讯)与通义灵码(阿里)是国内两大厂的 AI 编程助手。一句话结论 + 决策树 + 价格对比:腾讯生态与本土工作流选 CodeBuddy,阿里云与通义模型选通义灵码。

Cursor vs Aider:GUI IDE 还是 CLI?2026 对比

Cursor vs Aider 2026 选型对比:GUI IDE vs Git 原生 CLI,从 Composer vs Architect 双模型、Tab 补全、多模型 BYOK、价格计费、开源与否和适合人群判断,帮开发者选对。Cursor 是闭源 VS Code fork 月费 $20,Aider 是开源 Apache-2.0 CLI 自带 API key。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

Cursor vs GitHub Copilot:AI IDE 还是插件?2026 对比

Cursor vs GitHub Copilot 2026 选型对比:AI 原生 IDE vs IDE 插件,从 Composer vs Agent Mode、Tab 补全、多模型、AI Credits 计费、企业版和适合人群判断,帮开发者选对。Cursor 是 VS Code fork 重写交互层,Copilot 是 VS Code 插件继承原生体验。两家都已切 usage 制。