DeepSeek V4.1-Flash
DeepSeek V4.1-Flash 是深度求索 2026-09-10 发布的 552B MoE 模型,采用 Causal Encoder–Decoder 非对称架构(输入激活 8B / 输出激活 16B),支持 1M 上下文与原生视觉理解,权重以 MIT 许可开源。API 闲时 $0.15/$0.60 每百万 token,并自 2026-09-14 起接管全部 deepseek-v4-pro 请求。
发布 2026-09-14更新 2026-09-14核实 2026-09-14规格
- 厂商
- 深度求索
- 发布日期
- 2026/9/10
- 类型
- coding
- 上下文窗口
- 1000K tokens
- 最大输出
- 384K tokens
- 定价
- API 闲时 $0.15/$0.60 每百万 token,峰值 $0.30/$1.20;缓存命中 $0.003/$0.006 · 权重 MIT 免费自部署
- API 兼容
- openai, deepseek
基准测试
优势
- •MIT 许可开源权重,可私有化部署,源码不出境场景友好
- •闲时 $0.15/$0.60 + 缓存命中 $0.003,长上下文 Agent 跑批成本优势明显
- •1M 上下文、384K 最大输出,原生支持图片输入
- •KV cache 只需上代 1/4 HBM、1/8 SSD,缓存命中成本大幅下降
- •编程与终端类基准全面超过自家 V4-Pro(DeepSWE v1.1 74.2 vs 62.7)
不足
- •纯推理知识类基准回退:HLE 36.8 低于 V4-Pro 的 42.7,GPQA Diamond 90.9 vs 92.4
- •552B checkpoint 约 510 GB(FP8),自托管门槛从上代 2×H200 抬到约 8 卡节点
- •官方未公布自部署硬件要求与 tokens/s 数据,容量规划需自行压测
- •无独立推理档位,深度推理链路仍需搭配前沿模型
- •峰谷定价需排期:工作日 01:00–04:00、06:00–10:00 UTC 为 2 倍峰值
适用场景
概述
DeepSeek V4.1-Flash 是深度求索于 2026 年 9 月 10 日发布的模型,官方定位为新架构家族中「更小但更强」的一档:552B 参数 MoE,采用新的 Causal Encoder–Decoder 架构——输入侧仅激活 8B 参数、输出侧 16B,用非对称激活把推理成本压下来的同时保留旗舰级能力。
它是当前性价比最锋利的一档国产开源模型:1M 上下文、原生视觉理解、MIT 许可权重,闲时 API 价 $0.15 / $0.60 每百万 token。官方给出的判断是它在性能、费用、速度与总用时上已全面超过自家的 DeepSeek V4-Pro,因此有序下线 V4-Pro:北京时间 2026-09-14 12:00 起,所有 deepseek-v4-pro 请求路由到 V4.1-Flash 并按 Flash 单价计费,直到 V4.1-Pro 上线(官方未给日期)。
注意:旧模型 V4-Flash 与 V4-Flash-Vision-Exp 已退役;出于兼容,
deepseek-v4-flash与deepseek-v4-flash-vision-exp两个名字暂路由到 V4.1-Flash。上一代情况见 DeepSeek V4(V4-Pro / V4-Flash)。
核心能力
新架构:Causal Encoder–Decoder
非对称激活是这一代的核心设计——输入(prefill)只激活 8B、输出(decode)激活 16B。官方配套的说法是预训练方法更新 + 更大 scale 的 RL 后训练,使其在多个基准上超过自家旗舰 V4-Pro。
长上下文与缓存成本
1M 输入上下文、最大 384K 输出。真正影响账单的是 KV cache 体积:官方称所需 HBM 为上代的 1/4、SSD 存储 1/8。对 Agent 场景意义重大,因为缓存命中费用常常占 Agent 成本的大头,而 Flash 的缓存命中价只有未命中的 1/50。
多模态(原生视觉)
图片输入内置,无需再挂单独的 vision 模型。官方同时提到支持图片 + 文本混合输入。
基准表现(官方公布,非第三方复现)
| 基准 | V4.1-Flash | V4-Pro | 解读 |
|---|---|---|---|
| DeepSWE v1.1 | 74.2 | 62.7 | 编程 / PR 级任务大幅领先 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 终端 Agent 任务领先 |
| GPQA Diamond | 90.9 | 92.4 | 纯知识推理小幅回退 |
| HLE | 36.8 | 42.7 | 高难推理回退明显 |
形状很清楚:编程、终端、Agent 自动化类全面提升;纯推理知识类小幅回退。第三方(DataNorth)提醒,HLE 36.8 对 Opus-5.0 的 56.3 是数量级差距,不要把它放在研究助手或强事实问答的位置。
获取方式(定价 2026-09 核对)
| 通道 | 成本 | 适合 |
|---|---|---|
| 官方 API(闲时) | 输入 $0.15 / 输出 $0.60 每百万 token,缓存命中 $0.003 | 绝大多数在线与批量场景 |
| 官方 API(峰值) | 输入 $0.30 / 输出 $1.20,缓存命中 $0.006 | 无法排期的实时请求 |
| 自部署(MIT 权重) | 硬件成本自担,checkpoint 约 510 GB(FP8),约 8 卡节点起 | 数据不出境 / 合规场景 |
峰值时段为工作日 01:00–04:00 与 06:00–10:00 UTC(北京时间 09:00–12:00 与 14:00–18:00);其余时间与周末全部为闲时,闲时价格为峰值的一半。峰值价自 2026-09-10 12:00 生效。
API 调用示例
from openai import OpenAI
client = OpenAI(
api_key="sk-...",
base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
model="deepseek-flash", # 官方模型名;旧名 deepseek-v4-pro 自 2026-09-14 起同样路由至此
messages=[
{"role": "system", "content": "你是一个代码审查助手。只指出确定的问题,不要猜测。"},
{"role": "user", "content": "审查以下模块,列出潜在 bug 与重复代码:<粘贴代码>"},
],
max_tokens=8192,
)
print(resp.choices[0].message.content)
缓存命中价与未命中价相差 50 倍,稳定的 system prompt 与工具定义顺序是拿到低价的前提;每次请求动态拼接前缀会直接让缓存失效。
适合 / 不适合
适合
- 长上下文代码审查、接手陌生老仓库(整库一次喂入,省掉 RAG 切片)
- 高频 Agent 流水线:检索、规划、工具选择这类会放大 token 差异的场景
- 可排期的批量任务与离线 eval(挪到闲时窗口直接省一半)
- 合规要求「源码不出境」的团队(MIT 权重可自部署)
不适合
- 深度数学 / 长链条推理(HLE 36.8 是明确短板,应上前沿推理模型)
- 强事实准确性要求的研究助手类应用
- 硬件资源不足以承载约 510 GB checkpoint 的自部署团队
- 依赖
deepseek-v4-pro旧行为且无法接受静默替换的生产链路(需在 09-14 前完成回归评测)
相关阅读
- 模型卡:DeepSeek V4(V4-Pro / V4-Flash) · Kimi K3 · GLM-5.3 · GPT-6 Astra
- 工具卡:OpenRouter · OpenCode · CodeBuddy · Cursor
- 资讯:DeepSeek V4.1-Flash 与 V4 Pro 路由切换 · AI 编程与 Agent 周报 2026-09-14
- 概念:Prompt Caching · MoE 混合专家 · 长上下文 · 国产编程模型
来源
- DeepSeek V4.1 Flash:更强、更快、更普惠 — DeepSeek 官方
- DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient — DeepSeek API Docs
- DeepSeek releases DeepSeek-V4.1-Flash(定价与自托管门槛) — DataNorth
- DeepSeek V4.1 Flash: Pricing, Specs, V4 Pro Routing — Yotta Labs
- DeepSeek-V4.1-Flash 权重(MIT) — Hugging Face
- DeepSeek-V4.1-Flash 技术报告(PDF)
本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容;定价与能力以官网为准,欢迎在 反馈邮箱 反馈更新。
Aider vs OpenCode:两个开源终端 Agent,选哪个?2026 对比
Aider 与 OpenCode 2026 选型对比:两者都是开源终端 agent、都支持换模型,但 Aider 以 Git-native 工作流与成熟的多语言支持见长,OpenCode 主打模型无关、本地优先与终端交互体验。从 6 个维度给出明确取舍建议。
Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比
Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。
CodeBuddy vs 通义灵码:腾讯与阿里的 AI 编程助手怎么选(2026)
CodeBuddy(腾讯)与通义灵码(阿里)是国内两大厂的 AI 编程助手。一句话结论 + 决策树 + 价格对比:腾讯生态与本土工作流选 CodeBuddy,阿里云与通义模型选通义灵码。
Cursor vs Aider:GUI IDE 还是 CLI?2026 对比
Cursor vs Aider 2026 选型对比:GUI IDE vs Git 原生 CLI,从 Composer vs Architect 双模型、Tab 补全、多模型 BYOK、价格计费、开源与否和适合人群判断,帮开发者选对。Cursor 是闭源 VS Code fork 月费 $20,Aider 是开源 Apache-2.0 CLI 自带 API key。
Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)
Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。
Cursor vs GitHub Copilot:AI IDE 还是插件?2026 对比
Cursor vs GitHub Copilot 2026 选型对比:AI 原生 IDE vs IDE 插件,从 Composer vs Agent Mode、Tab 补全、多模型、AI Credits 计费、企业版和适合人群判断,帮开发者选对。Cursor 是 VS Code fork 重写交互层,Copilot 是 VS Code 插件继承原生体验。两家都已切 usage 制。