跳到主内容

阶跃星辰发布 Step 5 Preview:600B 稀疏 MoE、1M 上下文,权重 10-15 开放

2026-09-21 · Pandaily / AI-TLDR / DataLearner

要点

  • Step 5 Preview:约 600B 总参数 / 27B 激活的稀疏 MoE,92 层窄深 Transformer。
  • 1M 上下文,且输入与输出双向 1M——长文档/大批量代码一次调用吐完,不必应用层切片。
  • Artificial Analysis 智能指数 44(200 模型中第 24,中位数 24),与 Kimi K3(max)同分,但单任务成本约低 65%
  • API 价 $1.00 输入 / $2.70 输出(每百万 token),输出约 99.8 tok/s,TTFT 约 2.96 秒
  • BF16 权重计划 2026-10-15 开放;Preview 期仅 API 可用。
  • 输入支持文本 / 图像 / 视频(单次至多 60 张图),输出为文本。

时效说明:各来源对发布日口径不一(AI/TLDR 记 09-18,Pandaily / DataLearner 记 09-19–09-20),确切日期待核实。阶跃星辰尚未发布统一官方模型卡,以下规格来自第三方汇总与媒体报道。

为什么「窄深」是个信号

过去两年大模型扩规模的默认动作是加宽。Step 5 反过来:92 层窄深。阶跃星辰给的理由与 Agent 场景直接相关——在长 prefill 阶段(Agent 正在搜索、跑代码、吞工具返回值),更深的stack 提供更长的信息通路,支撑隐式多跳推理。

配合 Sparse GQA + 分块 token 合并,官方称 indexer 与 top-k 选择开销压到更密基线的约 1/8。训练侧强调在策略长程 RL、MoE 路由的比特级训练-推理对齐、MTP-3 投机解码与 KV cache offload,官方称长程 RL 端到端加速三倍以上。

AI 之家 观点:这一轮竞争的分水岭已经从「谁的参数大」转到「谁的长程任务单成本更低」。Step 5 用 600B/27B 的激活比去对位 Kimi K3 的 2.8T,本质是在打成本-智能帕累托前沿。对跑 Agent 舰队的团队,这比刷榜更有意义。

跑分:注意基准版本

基准分数
Terminal-Bench 2.185.0
Terminal-Bench 4.033.3(对比 DeepSeek V4.1 Flash 的 27%)
GPQA Diamond93.5
SWE-Marathon72.7(榜首)
MCP-Atlas85.6
BrowseComp88.7
MMMU-Pro76.0

两个 Terminal-Bench 分数差 50 分以上,原因是它们是两个不同版本的基准,难度不同,不构成模型退化。引用时务必带版本号。

一个容易被忽略的成本陷阱

人工分析记录 Step 5 Preview 在评测集上共生成 1.6 亿 token,而 200 个模型的中位数是 9200 万——它属于偏冗长的一档。

这意味着:输入单价 $1/M 很好看,但真正决定账单的是输出$2.70/M 的输出价,乘以一个 1.7 倍于中位数的输出量,实际单任务成本需要用真实业务样本测,不能只看价目表。

怎么上手

from openai import OpenAI

client = OpenAI(api_key="sk-...", base_url="https://api.stepfun.com/v1")  # 以官方文档为准
resp = client.chat.completions.create(
    model="step-5-preview",
    messages=[{"role": "user", "content": "通读这个仓库并列出三处并发隐患"}],
    extra_body={"reasoning_effort": "high"},   # low / medium / high 同一 id 可切
)

选型建议

  • 现在是长程 Agent + 成本敏感场景的高性价比选项;
  • 需要立刻私有化部署的团队,等到 10-15 权重放出再评估;
  • Zhihu 早期实测反馈其在事实性知识与复杂文档处理上仍有短板,建议先在自身样本集上验证。

相关阅读

来源

核对日期:2026-09-21。发布确切日期、权重开放后的许可条款待核实

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

相关评测