xAI 发布 Grok 4.5:与 Cursor 联合训练,Opus 级能力半价定价
2026-07-08 · xAI
要点
- 1.5T 参数 MoE(V9 底座,较 Grok 4.3 提升约 3 倍),最高 500K 上下文(可配置),支持视觉
- 用数万亿 token 的 Cursor 会话数据联合训练,主攻编程与 Agent
- 定价 $2/$6(fast 档 $4/$18),约为 Opus/Sol 级模型的一半;输出 80 TPS
- 同任务 token 消耗约为同级前沿模型一半;马斯克称"约等 Opus 4.7,但快得多"
- DeepSWE Bench 1.0 上超过 Opus 4.8
- 通过 xAI 控制台 / Grok Build / Cursor 使用;欧盟 7 月中旬开放
收购后的第一枪
Grok 4.5 是 SpaceX 收购 Cursor 后的首个联合技术落地。它的核心卖点不是"跑分最高",而是性价比:
| 模型 | Input(每 1M) | Output(每 1M) |
|---|---|---|
| Grok 4.5 | $2 | $6 |
| GPT-5.6 Sol | $5 | $30 |
| Claude Opus 4.7 | $5 | $25 |
马斯克的原话:"性能还没到(别尬吹),但其实大多数任务并不需要那么高的性能。"这句话精准点出了 2026 年的行业现实——当 Agent 任务的 token 账单成为企业采用 AI 的最大阻力时,"够用且便宜"比"最强"更有市场。
背景上下文
Grok 在编程赛道长期处于二线。Grok 4.3 虽然在通用对话上表现不错,但编程能力与 Claude、GPT 差距明显,在 Arena 编程榜上排名靠后。这直接导致 xAI 在 AI 编程这个增长最快的模型应用场景中几乎没有存在感。
SpaceX 收购 Cursor 改变了这个局面。Cursor 手握全球最大规模的开发者真实编程会话数据——包括代码补全的接受/拒绝、多步修改路径、调试上下文、重构决策等。这些数据对编程模型的后训练价值远超公开的 GitHub 代码库,因为它们反映的是"开发者如何使用 AI 辅助编程",而非单纯的"代码文本"。
Grok 4.5 是第一个充分利用这一数据优势的模型。它在收购协议签署后不到一个月就发布,说明 xAI 和 Cursor 团队在此之前已经开始联合训练。这也意味着后续模型(百万上下文版、2T 参数版)的迭代节奏可能会更快。
技术细节
- 1.5T MoE / V9 底座:Grok 4.5 基于 xAI 的 V9 训练底座,总参数 1.5T,较 Grok 4.3 的约 500B 提升约 3 倍。MoE 架构让单次推理的激活参数控制在较低水平,这是 $2/$6 定价能成立的技术基础。
- Cursor 会话数据后训练:训练使用了数万亿 token 的 Cursor 会话数据,涵盖代码补全、多文件编辑、调试、重构等真实开发场景。这类数据让模型学会了"开发者实际怎么写代码",而非仅仅"代码长什么样"。
- 500K 可配置上下文:上下文窗口最高 500K,但可按需配置更短窗口以降低成本。这种弹性配置对成本敏感的 Agent 任务很实用——多数任务不需要满上下文。
- 80 TPS 输出速度:输出速度 80 token/秒,显著快于多数同级模型(Claude Opus 约 50-60 TPS,GPT-5.6 Sol 约 60-70 TPS)。对交互式 Agent 场景,速度直接影响体验。
- token 效率:xAI 称同任务下 Grok 4.5 的 token 消耗约为同级前沿模型的一半,这得益于更紧凑的输出风格和更精准的工具调用。如果属实,真实成本优势比单价对比还要大。
- 视觉能力:支持视觉输入,可分析代码截图、UI 设计稿、图表等,这对"看图写代码"或"截图修 bug"场景有直接价值。
成本实测参考
据 Artificial Analysis 编程智能体指数测算,Grok 4.5 每项任务成本约 $2.49,对比 Codex 中 GPT-5.5 的 $5.07、Claude Code 中 Fable 5 的 $11.80,成本优势显著。但同一指数也显示,Grok 4.5 在 Grok Build 中的绝对能力低于 Claude Code 中的 Fable 5,与 Codex 中 GPT-5.5 大致持平。
一句话:它赢在单位成本,而不是绝对能力天花板。
| 模型 | 单任务成本 | 能力定位 |
|---|---|---|
| Grok 4.5 | $2.49 | 与 GPT-5.5 持平 |
| GPT-5.5 (Codex) | $5.07 | 前沿 |
| Fable 5 (Claude Code) | $11.80 | 最强 |
不止是"程序员助手"
Grok 4.5 还能按自然语言构建多表关联 + 网络抓取的 Excel 模型、在 PPT 里原生绘制形状图表、写结构化 Word 文档,应用场景延伸到法律与金融服务。马斯克还预告:下周百万上下文版、月底 2T 参数版。
这意味着 xAI 的野心不只是编程——它想用一个"便宜且够用"的模型覆盖整个知识工作场景。Excel 建模、PPT 生成、文档撰写这些高频办公任务,对模型能力的要求其实低于编程,Grok 4.5 的"性价比"定位在这些场景里更有杀伤力。
行业影响
Grok 4.5 的发布对几个层面有直接影响:
- 给前沿 Agent 市场打价格锚:$2/$6 的定价直接把"Opus 级能力"的价格腰斩,迫使 Claude 和 GPT 在编程场景面临降价压力。
- Cursor 有了"自家便宜模型":Cursor 可以把 Grok 4.5 设为默认模型,既降低对 Anthropic/OpenAI 的依赖,又降低用户的使用成本。这会增强 Cursor 的价格竞争力。
- 加速"模型分层"成为行业共识:Grok 4.5 的定位(Opus 4.7 级能力、半价)正好卡在旗舰与中端之间,与 GPT-5.6 Terra、Claude Sonnet 5 形成三方混战。
- 验证"数据闭环"的价值:Grok 4.5 的能力提升主要来自 Cursor 数据的后训练,而非底座模型的突破。这证明了"自有 IDE 数据"对编程模型的战略价值,可能引发更多模型厂商收购或自建 IDE。
AI 之家 观点
Grok 4.5 的意义在于给"贵得离谱"的前沿 Agent 市场打了一个价格锚。对成本敏感、任务以工程为主的团队,它值得进你的候选清单——但基准分不等于你项目里的表现,大规模采用前务必用自己的代码库实测。它也让 Cursor 有了一个"自家便宜模型"的默认选项,进一步降低对 Anthropic/OpenAI 的依赖。
建议的评估路径:在 Cursor 里把 Grok 4.5 设为一个项目的默认模型,跑两周真实开发任务,记录任务成功率、返工率和实际 token 成本,再与 Claude Sonnet 5 / GPT-5.6 Terra 对比。如果"成功率低 5% 但成本省 50%"对你可接受,那 Grok 4.5 就是你的主力模型。