DeepSeek V4.1-Flash 上线:552B MIT 开源权重,9 月 14 日起 V4 Pro 请求全部按 Flash 价路由
2026-09-14 · DeepSeek 官方 / DeepSeek API Docs / DataNorth / Yotta Labs
要点
- V4.1-Flash 于 2026-09-10 上线 DeepSeek API,模型名
deepseek-flash,官方定位是新架构家族里「更小但更强」的一档,552B 参数 MoE。 - 新架构:Causal Encoder–Decoder,输入侧仅激活 8B、输出侧 16B——用非对称激活把推理成本压下来,同时保留原生视觉理解(图片输入内置)。
- KV cache 大幅瘦身:官方称所需 HBM 为上代的 1/4、SSD 存储 1/8。对 Agent 类任务意义很大,因为缓存命中费用往往占 Agent 成本的大头。
- 旧模型下线:V4-Flash 与 V4-Flash-Vision-Exp 退役,出于兼容
deepseek-v4-flash、deepseek-v4-flash-vision-exp两个名字暂路由到 V4.1-Flash。 - 关键时间点:北京时间 2026-09-14 12:00 起,所有
deepseek-v4-pro请求路由到 V4.1-Flash,按 Flash 单价计费,直到 V4.1-Pro 上线(官方未给日期)。 - 定价(2026-09-10 生效):闲时输入 $0.15 / 输出 $0.60 每百万 token,峰值翻倍($0.30 / $1.20);缓存命中输入低至 $0.003。峰值时段为工作日 01:00–04:00 与 06:00–10:00 UTC。
- 开源:权重以 MIT 许可 发布于 Hugging Face,附技术报告;第三方实测 checkpoint 约 510 GB(FP8),自托管门槛从 V4-Flash 的 2×H200 抬到约 8 卡节点。
背景与分析
这不是一次常规的版本号 +1。DeepSeek 自己给出的理由是:多方测试显示 V4.1-Flash 在性能、费用、速度、总用时上已全面超越 DeepSeek V4 Pro,所以要有序下线 V4 Pro。
官方公布的对比(DeepSeek 自家表格,非第三方复现):
| 基准 | V4.1-Flash | V4-Pro | 变化 |
|---|---|---|---|
| DeepSWE v1.1 | 74.2 | 62.7 | ↑ 明显 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | ↑ |
| GPQA Diamond | 90.9 | 92.4 | ↓ |
| HLE | 36.8 | 42.7 | ↓ |
形状很清楚:编程 / 终端 / Agent 自动化类全面提升,纯推理知识类小幅回退。第三方(DataNorth)也提醒,HLE 36.8 对 Opus-5.0 的 56.3、Terminal-Bench 4.0 上约 20 分的差距是真实存在的——别把它放在研究助手或强事实问答的位置上。
真正需要开发者动手的不是模型本身,而是这次替换是静默发生的:
- 你的代码里如果硬编码了
deepseek-v4-pro,不会报错、不会中断,只是背后换了一个模型、账单降到约四分之一——这也正是它容易被忽略的原因。 - 如果你是按能力档位而非模型名做路由的(例如「Pro 档走深度推理」),那么 9 月 14 日就是必须重跑评测的日期。
- 峰谷定价意味着欧洲工作日上午处于 2 倍峰值、美国整个工作日处于闲时。能排期的批量任务与 eval 跑批,值得挪到闲时窗口。
对开发者的影响
- 成本结构变了:缓存命中价 $0.003 vs 未命中 $0.15,相差 50 倍。任何带稳定 system prompt 或重复文档上下文的工作流,都应该先把缓存设计好再谈模型选型。
- 按能力路由的团队要重测:建议抽 50–100 条代表性的 V4 Pro 请求,对比 V4.1-Flash 在成本、延迟、结构化输出合法性、拒答率、多模态准确率上的差异,再决定是否接受新行为。
- 自托管要重算账:MIT 许可 + 权重开放对合规场景(源码不能出境)是实打实的好消息,但 552B / 约 510 GB 的 checkpoint 把硬件门槛抬了三倍,且官方未公布硬件要求与 tokens/s 数据——部署前需要自己压测。
- 工具链已跟上:官方点名的合作方 WorkBuddy(含 CodeBuddy)与 OpenCode 已全量接入;走 OpenRouter 一类的聚合网关则要等上架。
AI 之家 观点
这是 2026 年下半年最值得记的一条**「成本即发布特性」**的案例。
- 厂商开始主动把自己的旗舰流量往便宜模型上赶。DeepSeek 不是先发 V4.1-Pro 再降 Pro 的价,而是直接让 Pro 名字指向 Flash。这说明在 Agent 高频调用场景里,单位任务成本已经比榜单名次更能决定模型的生死。
- 「按名字调用」的风险被正式摆上台面。同一周里,Kimi 把
kimi-for-coding无感升级为 K2.8 Preview、DeepSeek 把deepseek-v4-pro指向 Flash——模型名不再是稳定契约。生产系统应该把模型能力档位与模型名解耦,并对关键路径做定期回归评测。 - 对国内开发者的实际收益是最直接的:闲时 $0.15/$0.60、缓存命中 $0.003,配合 MIT 权重,长上下文 Agent 跑批的成本下降是一周内就能在账单上看出来的量级。
判断建议:跑量的 Agent / 代码审查 / 批处理,直接切 Flash 并优先优化缓存命中;深度推理链路保留前沿模型,不要因为便宜就把整条流水线换成同一个模型。
相关阅读
- 模型卡:DeepSeek V4(V4-Pro / V4-Flash) · Kimi K3 · GPT-6 Astra
- 工具卡:OpenRouter · OpenCode · CodeBuddy · Claude Code
- 相关资讯:AI 编程工具周报 2026-09-13 · GLM-5.3 发布
- 概念:Prompt Caching · MoE 混合专家 · 长上下文