xAI 发布 Grok 4.7:2.1 万亿参数如期上线,但官方 model card 仍然缺席
2026-09-16 · 央广网 / DEV Community / CSDN AI 资讯日报 / Cryptopolitan
要点
- 2026-09-12,xAI 如期发布 Grok 4.7,参数规模 2.1 万亿,较 Grok 4.6 的 1.5 万亿增长约 40%。
- 马斯克的说法:新模型除服务速度略慢外,在工程与科学推理上「优于所有模型」,token 效率更高;初始预训练已在中旬完成,正用 SpaceX 公司数据补充训练,以强化真实世界工程任务能力。
- 迭代节奏:这是 xAI 不到两个月内的第三次 Grok 迭代(7 月 4.5、8 月 4.6、9 月 4.7),节奏明显是要把对手拖进自己的发布日历。
- 可信度边界(关键):截至发稿,Grok 4.7 仍无官方 model card、基准套件与定价页;xAI 文档库(docs.x.ai)在发布当周仍只列到 grok-4.6。所有能力数据来自马斯克本人陈述与发布前传闻,参数与能力口径待核实。
- 发布前的市场押注被证伪:此前多家媒体把 4.7 写成「如期跳票」,Polymarket 上「9/18 才发」的概率一度高达 64.5%。
- 马斯克自己先降了温:发布前他在 X 上表示 4.7「大致与 Opus 5.0 相当,不是 5.1」,「有些方面更好、有些更差」,多模态仍需改进;并解释延迟原因是强化学习阶段过度惩罚响应长度,导致模型「过早放弃它本可以完成的困难任务」。
- 路线图(均为口头表述):Grok 4.8 = 2.5 万亿参数、基于 xAI 新的 C++ 训练栈,本周完成训练后进入 RL;4.9 目标「Astra / Fable 级」;Grok 5「也许比任何东西都好」(无日期、无证据)。
背景与分析
一、2.1 万亿参数是一次明确的「规模即差距」下注
独立评测对 Grok 4.6 基线的定位是:领先 GPT-5.6 Sol,但落后于 Claude Opus 5 与 Fable 5。
也就是说,xAI 上一代赢在单位成本($2/$6 的定价 + 61 的 AA 智能指数),而不是绝对能力天花板。4.7 把参数从 1.5T 推到 2.1T,逻辑很直白:既然单位成本优势已经兑现,剩下的差距就用规模去填。
这条路能否走通,目前无法验证——因为没有可验证的东西。这引出了本次发布最值得讨论的问题。
二、真正的问题在「评测」,不在参数
Grok 4.7 目前的状态是:参数有数字、能力有说法、评测没有。
具体缺口:
| 项目 | 状态 |
|---|---|
| 参数规模 | 2.1 万亿(马斯克陈述,非官方 model card) |
| 上下文窗口 | 未公开 |
| API 定价 | 未公开 |
| 官方基准套件 | 未公开 |
| API model ID | 官方文档仍以 grok-4.6 为最新 |
| 独立第三方评测 | 截至发稿未见 |
对比同期其他前沿模型:Claude Fable 5.1 有已公开的第三方 Terminal-Bench-Science 成绩(52.6%)与定价($10/$50 每百万 token);GPT-6 Astra 有 Perplexity WANDR 这类第三方基准的跑分。唯独 Grok 4.7 的所有能力数据都只有创始人陈述这一个来源。
这不是要否定 Grok 4.7,而是要指出一个正在扩散的行业现象:当每一家都把自己的模型叫「最强」,且都不提供可复现的评测,参数量就成了唯一的叙事货币。 参数可以一日暴涨 40%,信任却只能靠一次次复现积累。
三、「用 SpaceX 数据补训」是个有意思的信号
马斯克提到正在用 SpaceX 的工程数据给 4.7 做补充训练,目标是强化真实世界工程任务能力。
如果属实,这是一个区别于通用语料训练的差异化路径:火箭遥测、制造工艺、故障排查记录这类数据,公开互联网上几乎不存在,且高度贴合「工程推理」这个 Grok 主打的能力标签。
但要提醒两点:一是这类数据无法被第三方验证,二是它对应的能力(航天、制造工程)对绝大多数开发者的日常工作没有直接迁移价值。真正的检验标准仍然是通用编程基准与 Agent 长任务表现——而这些数据目前都没有。
四、发布节奏本身也是竞争武器
不到三个月,三次大版本迭代(4.5 → 4.6 → 4.7),且 4.8 已经排进本周。
这种节奏的战术含义是:迫使竞争对手的评测、集成与采购决策永远处于「等下一代」的悬置状态。对使用者而言代价也很明确——每一代的实际可用生命周期被压缩到以周计,你为某一代做的调优、prompt 与评测集,可能在两个月内就要重做。
对开发者的影响
- 先别迁移,等官方端点。 在 xAI 官方文档出现
grok-4.7的 model ID、定价页与上下文窗口之前,任何「迁移到 4.7」的动作都是在赌传闻。生产环境继续用 4.6。 - 用 OpenRouter 之类聚合层做灰度。 聚合网关通常在官方接入后很快同步,且能按流量比例切换——比直接改代码里的模型名安全得多。
- 把「模型名」当不稳定依赖管理。 4.5→4.6→4.7 的节奏说明 Grok 系列的型号更新不会给长过渡期。所有模型名都应该走配置而非硬编码,并保留快速回滚能力。
- Cursor 用户注意默认模型变化。 Grok 4.6 曾在发布首日登陆 Cursor;4.7 接入后是否替换默认档位,需要主动确认,而不是等账单变了自己发现。
- 给自己的评测集留一份 Grok 的位置。 等官方端点与定价出来后,用你自己的任务跑一遍,比任何第三方基准都更接近你的真实成本结构。
- 不要为「2.1 万亿参数」付溢价。 参数量是投入指标,不是产出指标。定价出来后,看的是每完成一个任务的成本,不是每百万 token 的单价。
AI 之家 观点
- 这次发布的真正信息是「没有 model card」。 一家前沿实验室在 2026 年 9 月发布旗舰模型,却不提供官方模型卡、基准与定价——这本身比 2.1 万亿参数更能说明它的工程与流程成熟度。参数可以靠堆,可复现性不能。
- 马斯克自己的降温比外界的批评更值得听。 「大致与 Opus 5.0 相当,不是 5.1」「多模态仍需改进」「RL 惩罚响应长度导致过早放弃难任务」——这些是罕见的产品方自我暴露。它说明 4.7 至少在发布时点不是一台无短板的机器,尤其是长任务坚持度,而这恰恰是 Agent 场景最要命的指标。
- 「规模即正义」在 2026 年已经是个需要自证的假设。 DeepSeek 用 552B 的 V4.1-Flash 在编程与终端基准上打穿了自家更大的 V4 Pro;Kimi 用 1M 上下文的 K2.8 Preview 逼近旗舰 K3。架构与工程带来的单位效率提升,正在和纯参数扩张分庭抗礼。 2.1T 是 Grok 的答案,但不是行业的唯一答案。
- 对使用者的建议只有一句:把可验证性当采购标准。 谁公开 model card、公开基准方法、公开定价与限流,谁才值得你把生产流量交出去。这不是道德要求,是降低你自己技术决策风险的最低门槛。参见 Grok 4.6 与 GPT-6 Astra。
相关阅读
- 模型卡:Grok 4.7 · Grok 4.6 · Grok 4.5 · GPT-6 Astra · Claude Fable 5.1
- 工具卡:Cursor · OpenRouter
- 概念:MoE · 推理模型 · 长上下文 · BYOK
- 相关资讯:AI 编程周报 2026-09-16 · AI 减速论与算力股下挫 · Amodei 呼吁为前沿研发调速
来源
- 大模型训练进入十万卡时代 三巨头为何集体"踩刹车"? — 央广网
- AI Roundup (Sat Sep 12) — DEV Community
- AI 资讯日报 | 2026 年 9 月 12 日 — CSDN
- Musk teases AGI with Grok 5 even as 4.7 trails Anthropic and OpenAI's newest models — Cryptopolitan
可信度声明:Grok 4.7 的参数规模、能力表述与路线图均来自马斯克本人在 X 的公开陈述及多家日报汇总,xAI 官方 model card、基准套件、上下文窗口与定价截至 2026-09-16 仍未公开,xAI 文档库最新条目仍为 grok-4.6。上线与迁移决策请以 xAI 官方文档为准。