跳到主内容
reasoning阶跃星辰

阶跃星辰 Step 5 Preview

阶跃星辰(StepFun)Step 5 Preview 模型详解:600B 稀疏 MoE(激活约 27B)、92 层窄深结构、1M 上下文,主打长程 Agent 与编程。Artificial Analysis 智能指数 44,API 价 $1/$2.7 每百万 token,BF16 权重计划 2026-10-15 开放。

发布 2026-09-21更新 2026-09-21核实 2026-09-21

规格

厂商
阶跃星辰
发布日期
2026/9/19
类型
reasoning
上下文窗口
1000K tokens
最大输出
1000K tokens
定价
输入 $1.00/M · 输出 $2.70/M token(API only)
API 兼容
openai

基准测试

44(200 模型中第 24,中位数 24)
Artificial Analysis 智能指数
85.0
Terminal-Bench 2.1
33.3
Terminal-Bench 4.0
93.5
GPQA Diamond
85.6
MCP-Atlas
72.7(第 1)
SWE-Marathon
88.7
BrowseComp
76.0
MMMU-Pro

优势

  • 600B 稀疏 MoE、激活约 27B,长程 Agent 与编程定位
  • 1M 上下文且输入/输出双向 1M,长任务不必切片
  • 人工分析智能指数 44,与 Kimi K3(max)同分但单任务成本约低 65%
  • 可在同一 model id 上切 low/medium/high 三档推理强度
  • BF16 权重计划 2026-10-15 开放,届时可自托管

不足

  • Preview 期仅 API 可用,尚无权重下载,无法私有化部署
  • 官方评测口径偏乐观,第三方独立复现仍有限
  • 输出冗长:AA 评测集共生成 1.6 亿 token(中位数 9200 万),输出成本被放大
  • Zhihu 早期实测反馈事实性知识与复杂文档处理仍有短板

适用场景

一次性读入整个仓库的长程编程 Agent大批量 PDF / 长文档的分析与研究Agent 环路里的截图、图表与视频理解金融与专业知识的长链推理任务

2026-09 首发注记:Step 5 Preview 于 2026 年 9 月中旬发布,各来源对确切日期口径不一(AI/TLDR 记为 09-18,Pandaily 与 DataLearner 记为 09-19 / 09-20),本站暂采 09-19 并标注待核实。下列规格与跑分均来自第三方汇总与媒体报道,阶跃星辰尚未发布统一的官方模型卡,请以官方后续公告为准。

概述

Step 5 Preview 是阶跃星辰(StepFun)的新一代旗舰基座模型,采用稀疏 MoE 架构:总参数约 600B,每 token 激活约 27B。它面向的是长程 Agent 工作负载——AI 编程、软件工程、金融分析与专业知识工作,而不是单纯的对话。

两个数字定义了它的定位:1M token 上下文,且输出侧同样是 1M。多数模型把长上下文只放在输入侧,Step 5 把输出也拉到 1M,意味着一次调用可以直接吐出整份长文档或整批代码,不必在应用层切片拼接。

AI 之家 观点:Step 5 Preview 真正的看点不是 600B 这个数字,而是「智能指数 44 + 输入 $1/M」这组性价比。它把长程 Agent 的单任务成本往下压了一大截——如果你的瓶颈是「Agent 跑得动但跑不起」,它值得一测;但 Preview 期拿不到权重,数据合规场景还得等 10-15。

架构:为什么是「窄深」

Step 5 没有继续把网络加宽,而是走 92 层的窄深 Transformer。阶跃星辰的理由是:在长 prefill 阶段——Agent 正在搜索、跑代码、吞工具返回值的时候——更深的结构能提供更长的信息通路,支撑隐式多跳推理。

为了让 1M 会话真正可用,它引入了 Sparse Grouped-Query Attention + 分块 token 合并。官方称这把 indexer 与 top-k 选择的开销压到更密基线的约 1/8,同时合并相邻的重复选择。

训练侧强调在策略(on-policy)长程强化学习,并在 MoE 路由上做训练与推理的比特级对齐,配合负载感知调度、MTP-3 投机解码、FP8 MoE 与 KV cache offload。官方称长程 RL 端到端加速三倍以上,样本账本损失低于 1%。

规格数值
架构稀疏 MoE,92 层窄深 Transformer
总参数 / 激活参数约 600B / 约 27B
上下文 / 最大输出1M / 1M token
输入模态文本、图像、视频(单次最多 60 张图)
输出模态文本
推理强度low / medium / high,同一 model id 可切
输出速度约 99.8 tok/s(AA 实测),TTFT 约 2.96s
权重Preview 期 API only;BF16 权重计划 2026-10-15 开放

跑分怎么看

官方与第三方汇总给出的关键分数如下(口径见注):

基准分数说明
Artificial Analysis 智能指数44200 个模型中第 24 位,中位数为 24
Terminal-Bench 2.185.0与 4.0 是不同版本,不可横向比较
Terminal-Bench 4.033.3对比 DeepSeek V4.1 Flash 的 27%
GPQA Diamond93.5科学推理(无工具,high 档)
SWE-Marathon72.7该榜第 1 名
MCP-Atlas85.6工具编排
BrowseComp88.7检索浏览
MMMU-Pro76.0多模态理解

读表提醒:Terminal-Bench 2.1 的 85.0 与 4.0 的 33.3 分属两代不同基准,分数差异来自基准难度而非模型退化——引用时务必带上版本号,否则极易误导。

成本侧是它最硬的卖点:在人工分析智能指数同为 44 的前提下,Step 5 Preview 的单任务成本约为 Kimi K3(max)的 35%(约低 65%)。

定价

项目价格
输入$1.00 / 百万 token
输出$2.70 / 百万 token

但要注意冗长系数:人工分析记录它在评测集上共生成 1.6 亿 token,而中位数只有 9200 万。也就是说它倾向于写长答案——输出端成本比输入单价更值得盯

调用示例

from openai import OpenAI

client = OpenAI(
    api_key="sk-...",
    base_url="https://api.stepfun.com/v1",  # 以官方最新文档为准
)

resp = client.chat.completions.create(
    model="step-5-preview",
    messages=[
        {"role": "user", "content": "通读这个仓库,列出三处最可能引发并发 bug 的地方并给出修复补丁"}
    ],
    # 同一 model id 上切换推理强度,按任务深度权衡成本
    extra_body={"reasoning_effort": "high"},
)
print(resp.choices[0].message.content)

与同档模型怎么选

维度Step 5 PreviewKimi K3DeepSeek V4.1 Flash
参数600B(激活 27B)2.8T未公开
上下文1M / 输出 1M1M1M
智能指数4444(max 档)更低档
输入价$1.00/M约 $2.3/M更低
权重2026-10-15 计划开放已开源已开源
单任务成本最低
  • 追性价比的长程 Agent → Step 5 Preview。
  • 要立刻拿到权重做私有化Kimi K3DeepSeek V4,Step 5 需等到 10-15。
  • 预算极敏感的跑量任务DeepSeek V4.1 Flash

避坑清单

  • Preview ≠ 开源:现在只能通过 API 用,无法下载权重;需要自托管的团队把评估节点排到 10-15 之后
  • 先小范围验证再放量:Zhihu 早期实测反馈其在科学/编程类任务强,但事实性知识与复杂文档处理仍有短板。
  • 按任务切推理强度:low/medium/high 同一 id 可切,别所有请求都默认 high。
  • 盯输出 token 数:冗长倾向会显著放大账单,建议在网关层设 max_tokens 上限。

FAQ

Q:Step 5 Preview 是开源模型吗? A:目前不是。它通过阶跃星辰 API 提供服务,权重尚未开放。官方计划 2026-10-15 放出 BF16 权重,届时是否附带商用许可待核实

Q:为什么两个 Terminal-Bench 分数差这么多? A:因为它们是不同版本的基准(2.1 与 4.0),4.0 难度显著提高。85.0 与 33.3 不构成性能退化,引用时必须标注版本。

Q:和 Kimi K3 相比该怎么选? A:智能指数同为 44,但 Step 5 单任务成本约低 65%。若你需要立刻自托管,Kimi K3 权重已开放;若不急且能等 10-15,Step 5 的成本结构更有利。

延伸阅读

来源

核对日期:2026-09-21。发布确切日期、权重开放后的许可条款两项待核实

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。