跳到主内容

DeepSeek V4.1-Flash 上线:552B MIT 开源权重,9 月 14 日起 V4 Pro 请求全部按 Flash 价路由

2026-09-14 · DeepSeek 官方 / DeepSeek API Docs / DataNorth / Yotta Labs

要点

  • V4.1-Flash 于 2026-09-10 上线 DeepSeek API,模型名 deepseek-flash,官方定位是新架构家族里「更小但更强」的一档,552B 参数 MoE
  • 新架构:Causal Encoder–Decoder,输入侧仅激活 8B、输出侧 16B——用非对称激活把推理成本压下来,同时保留原生视觉理解(图片输入内置)。
  • KV cache 大幅瘦身:官方称所需 HBM 为上代的 1/4、SSD 存储 1/8。对 Agent 类任务意义很大,因为缓存命中费用往往占 Agent 成本的大头
  • 旧模型下线:V4-Flash 与 V4-Flash-Vision-Exp 退役,出于兼容 deepseek-v4-flashdeepseek-v4-flash-vision-exp 两个名字暂路由到 V4.1-Flash。
  • 关键时间点:北京时间 2026-09-14 12:00 起,所有 deepseek-v4-pro 请求路由到 V4.1-Flash,按 Flash 单价计费,直到 V4.1-Pro 上线(官方未给日期)。
  • 定价(2026-09-10 生效):闲时输入 $0.15 / 输出 $0.60 每百万 token,峰值翻倍($0.30 / $1.20);缓存命中输入低至 $0.003。峰值时段为工作日 01:00–04:00 与 06:00–10:00 UTC。
  • 开源:权重以 MIT 许可 发布于 Hugging Face,附技术报告;第三方实测 checkpoint 约 510 GB(FP8),自托管门槛从 V4-Flash 的 2×H200 抬到约 8 卡节点。

背景与分析

这不是一次常规的版本号 +1。DeepSeek 自己给出的理由是:多方测试显示 V4.1-Flash 在性能、费用、速度、总用时上已全面超越 DeepSeek V4 Pro,所以要有序下线 V4 Pro。

官方公布的对比(DeepSeek 自家表格,非第三方复现):

基准V4.1-FlashV4-Pro变化
DeepSWE v1.174.262.7↑ 明显
Terminal-Bench 2.190.687.9
GPQA Diamond90.992.4
HLE36.842.7

形状很清楚:编程 / 终端 / Agent 自动化类全面提升,纯推理知识类小幅回退。第三方(DataNorth)也提醒,HLE 36.8 对 Opus-5.0 的 56.3、Terminal-Bench 4.0 上约 20 分的差距是真实存在的——别把它放在研究助手或强事实问答的位置上

真正需要开发者动手的不是模型本身,而是这次替换是静默发生的

  • 你的代码里如果硬编码了 deepseek-v4-pro不会报错、不会中断,只是背后换了一个模型、账单降到约四分之一——这也正是它容易被忽略的原因。
  • 如果你是按能力档位而非模型名做路由的(例如「Pro 档走深度推理」),那么 9 月 14 日就是必须重跑评测的日期
  • 峰谷定价意味着欧洲工作日上午处于 2 倍峰值、美国整个工作日处于闲时。能排期的批量任务与 eval 跑批,值得挪到闲时窗口。

对开发者的影响

  • 成本结构变了:缓存命中价 $0.003 vs 未命中 $0.15,相差 50 倍。任何带稳定 system prompt 或重复文档上下文的工作流,都应该先把缓存设计好再谈模型选型
  • 按能力路由的团队要重测:建议抽 50–100 条代表性的 V4 Pro 请求,对比 V4.1-Flash 在成本、延迟、结构化输出合法性、拒答率、多模态准确率上的差异,再决定是否接受新行为。
  • 自托管要重算账:MIT 许可 + 权重开放对合规场景(源码不能出境)是实打实的好消息,但 552B / 约 510 GB 的 checkpoint 把硬件门槛抬了三倍,且官方未公布硬件要求与 tokens/s 数据——部署前需要自己压测
  • 工具链已跟上:官方点名的合作方 WorkBuddy(含 CodeBuddy)与 OpenCode 已全量接入;走 OpenRouter 一类的聚合网关则要等上架。

AI 之家 观点

这是 2026 年下半年最值得记的一条**「成本即发布特性」**的案例。

  1. 厂商开始主动把自己的旗舰流量往便宜模型上赶。DeepSeek 不是先发 V4.1-Pro 再降 Pro 的价,而是直接让 Pro 名字指向 Flash。这说明在 Agent 高频调用场景里,单位任务成本已经比榜单名次更能决定模型的生死
  2. 「按名字调用」的风险被正式摆上台面。同一周里,Kimi 把 kimi-for-coding 无感升级为 K2.8 Preview、DeepSeek 把 deepseek-v4-pro 指向 Flash——模型名不再是稳定契约。生产系统应该把模型能力档位与模型名解耦,并对关键路径做定期回归评测。
  3. 对国内开发者的实际收益是最直接的:闲时 $0.15/$0.60、缓存命中 $0.003,配合 MIT 权重,长上下文 Agent 跑批的成本下降是一周内就能在账单上看出来的量级。

判断建议:跑量的 Agent / 代码审查 / 批处理,直接切 Flash 并优先优化缓存命中;深度推理链路保留前沿模型,不要因为便宜就把整条流水线换成同一个模型

相关阅读

来源

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Aider vs OpenCode:两个开源终端 Agent,选哪个?2026 对比

Aider 与 OpenCode 2026 选型对比:两者都是开源终端 agent、都支持换模型,但 Aider 以 Git-native 工作流与成熟的多语言支持见长,OpenCode 主打模型无关、本地优先与终端交互体验。从 6 个维度给出明确取舍建议。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

相关评测