跳到主内容

AI 编程与 Agent 周报 2026-09-14:Grok 4.7 冲到 2.1T、同模型 token 差 70 倍、WPS AI 表格 Agent 登顶

2026-09-14 · InfoQ / 量子位 / 观察者网 / IT 之家 / 北京商报 / DEV Community / HeadsUpAI / TechCrunch

本期覆盖 2026-09-08 至 2026-09-14。所有数字均来自公开来源,厂商自述数据已单独标注;未标注来源的能力描述按「待核实」处理

要点

  • 模型侧:xAI 发布 Grok 4.7(2.1T 参数);月之暗面 K2.8 Preview 全量上线并开放百万上下文;DeepSeek V4.1-Flash 上线并将于 9-14 接管 V4 Pro 流量。
  • 成本侧:InfoQ 三组测试发现,同一底层模型下不同 AI 编程工具的 token 消耗可相差 70 倍,差异来自 Agent 框架的启动开销与缓存命中率。
  • 能力侧GPT-6 Astra 解出 FrontierMath Tier 4 全部剩余题目,Epoch AI 宣布该层级饱和(97.6%,此前最高 5%)。
  • 评测标准侧WPS AI 表格 Agent 登顶 SpreadsheetBench V2(50.86%);中国信通院发布方升-Code 2.0代码能力基准。
  • 工程纪律侧:Claude Code 之父鲍里斯·切尔尼公开表示,开发者的核心职责是守住代码质量;25 位菲尔兹奖得主联署批评 AI 正在「露天开采」数学。

一、模型:更大与更便宜同时加速

xAI Grok 4.7(2026-09-12):参数规模 2.1 万亿,较 Grok 4.6 的 1.5 万亿增长约 40%。马斯克称新模型除服务速度略慢外各方面优于前代、token 效率更高,并以 SpaceX 工程数据做补充训练以强化真实世界工程任务。

待核实:截至发稿,xAI 官方模型文档仍以 Grok 4.6 为最新,未见 Grok 4.7 的 model card、上下文窗口、定价与 API 标识。参数量与能力口径目前来自马斯克本人及多家日报汇总,上线前请以官方文档为准。

Kimi K2.8 Preview(2026-09-11):全量上线 Kimi Code / Kimi Work,Model ID 仍为 kimi-for-coding1M 上下文向全部会员档位开放。详见 Kimi K2.8 Preview 全量上线

DeepSeek V4.1-Flash(2026-09-10):552B MoE、MIT 开源权重、北京时间 9-14 12:00 起接管所有 deepseek-v4-pro 请求。详见 DeepSeek V4.1-Flash 与 V4 Pro 路由切换

Agnes AI Agnes-3.0-Flash:330 亿参数开源多模态模型,Apache 2.0 许可、262K 上下文,官方称可在单张 H200 或 H100 上运行。

二、成本:同一个模型,账单能差 70 倍

InfoQ 的三组测试给出了本期最实用的一条结论:即便底层模型完全相同,不同 AI 编程工具的实际 token 消耗可以相差 70 倍

差异不在模型,而在两处:

  1. Agent 框架的启动开销——每次会话固定注入多少上下文、工具定义是否全量塞进 prompt;
  2. 缓存命中率——系统提示词与工具定义是否稳定到能被命中。

这直接推翻了「选型 = 比较模型报价」的做法。对团队来说,正确的度量单位是「每个完成任务的成本」,而不是「每百万 token 的单价」。一个便宜但总停在 70% 进度的尝试,会产生人工兜底成本;一个更贵但能跑完、自测、写文档的运行,总成本反而更低。

同一周的 DeepSeek V4.1-Flash 定价也印证了这一点:缓存命中输入 $0.003、未命中 $0.15,相差 50 倍——先把缓存设计好,再谈模型选型。

三、能力:数学「最后高墙」与榜单饱和

GPT-6 Astra 攻克 FrontierMath Tier 4:解出该层级剩余的全部问题,Epoch AI 宣布该层级已饱和;成绩从该层级此前最高的 5% 提升到 97.6%,意味着整套 FrontierMath 已被完整攻克。这件事的连带问题是评测体系本身是否需要更新——当一套基准在一周内从 5% 跳到 97.6%,它的区分度已经失效。

25 位菲尔兹奖得主联署(2026-09-11):陶哲轩、Peter Scholze、吴宝珠、Maxim Kontsevich、James Maynard 等发表《人工智能在数学中的严重错位》(A Severe Misalignment of AI in Mathematics)。核心论点:AI 公司把「解决著名数学难题」当作 benchmark,与数学共同体追求「概念理解与新洞见」的目标严重错位;批量生产缺乏缜密论证的思想会切断人类知识传承链。导火索是 OpenAI 于 9-08 宣布以约 1 万个 Agent 并发、约 88 小时给出纳维-斯托克斯千禧年难题的解答。

四、评测标准:垂类 Agent 与新基准登场

事件关键数据来源
WPS AI 表格 Agent 登顶 SpreadsheetBench V2 Full50.86%,超过 Claude Opus 4.6(34.89%)、GPT-5.2(26.79%)、Gemini 3.1 Pro(23.68%),三个月内第三次登顶观察者网 2026-09-13
中国信通院发布方升-Code 2.09-11 于服贸会发布,面向代码生成与智能体协作场景的标准化代码能力评估体系北京商报 2026-09-11
Artificial Analysis 智能指数 v4.2新增 AA-Briefcase(agentic 知识工作)与 Surge AI GDP.pdf(长文档推理),移除已饱和的 GPQA Diamond,私有 held-out 测试权重翻倍至 40%HeadsUpAI

值得单独说一句 WPS AI:在通用能力趋同的背景下,垂类 Agent 在细分任务上跑赢国际大厂,说明国产办公 AI 正从模型比拼转向专业场景深耕。这条路径对做垂直工具的团队有参考价值——与其在通用榜单上硬碰,不如在一个可度量的细分任务上做到第一。

五、工程与工具:本地推理、Agent 治理与「代码质量」回归

  • Perplexity 开源 Lily:面向 Apple silicon 的本地推理引擎,针对 Qwen3.6-35B-A3B 做算子级映射,官方称在 M5 Max MacBook Pro 上相对 MLX-LM prefill 快 1.23×、decode 快 1.35×,Rust runtime + 自研 Metal kernel。
  • Meta Muse Spark 1.3:长程 agentic 与编程任务提升,会主动澄清问题并确认关键操作;内部对比称工具调用减少 20%、token 减少 25%,已在 Muse Code 与 Meta Model API 上线。
  • Kiteworks 收购 Bonfy.AI:补强运行时数据分类能力,可识别邮件、文件共享、API 与 AI Agent 流量中的敏感数据——Agent 自主调用接口后,数据流的实时治理正从合规选项变为基础设施
  • Claude Code 之父谈 AI 编程:鲍里斯·切尔尼表示,AI 改变软件开发后,开发者真正要守住的不是亲手写每一行代码,而是代码质量本身;他提到每天都会收到「如何处理 AI 垃圾代码」的来信。

AI 之家 观点

本期四条线索指向同一个转折:2026 下半年的竞争维度,正从「模型更强」扩散到「更便宜、更可控、更可度量」

  1. 成本度量单位换了。token 单价已经不足以做选型依据——**框架开销(70 倍差距)与缓存设计(50 倍价差)**才是大头。团队应把「每完成任务的成本」写进监控面板。
  2. 评测正在失效与重建同时发生。FrontierMath Tier 4 一周内从 5% 到 97.6%、Artificial Analysis v4.2 移除 GPQA Diamond、信通院推出方升-Code 2.0——榜单的半衰期已经短到季度级。任何依赖单一榜单做采购决策的做法都该淘汰。
  3. 垂类 Agent 的价值被重新发现。WPS AI 表格 Agent 的登顶说明:在一个可度量的细分任务上做到第一,比在通用榜上排第十更有商业价值
  4. 工程纪律在回潮。切尔尼那句「守住代码质量」和 25 位菲尔兹奖得主的联署,本质是同一件事:当生成成本趋近于零,判断力与验证能力就成了唯一的稀缺资源。

相关阅读

来源

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

相关评测