AI 编程与 Agent 周报 2026-09-14:Grok 4.7 冲到 2.1T、同模型 token 差 70 倍、WPS AI 表格 Agent 登顶
2026-09-14 · InfoQ / 量子位 / 观察者网 / IT 之家 / 北京商报 / DEV Community / HeadsUpAI / TechCrunch
本期覆盖 2026-09-08 至 2026-09-14。所有数字均来自公开来源,厂商自述数据已单独标注;未标注来源的能力描述按「待核实」处理。
要点
- 模型侧:xAI 发布 Grok 4.7(2.1T 参数);月之暗面 K2.8 Preview 全量上线并开放百万上下文;DeepSeek V4.1-Flash 上线并将于 9-14 接管 V4 Pro 流量。
- 成本侧:InfoQ 三组测试发现,同一底层模型下不同 AI 编程工具的 token 消耗可相差 70 倍,差异来自 Agent 框架的启动开销与缓存命中率。
- 能力侧:GPT-6 Astra 解出 FrontierMath Tier 4 全部剩余题目,Epoch AI 宣布该层级饱和(97.6%,此前最高 5%)。
- 评测标准侧:WPS AI 表格 Agent 登顶 SpreadsheetBench V2(50.86%);中国信通院发布方升-Code 2.0代码能力基准。
- 工程纪律侧:Claude Code 之父鲍里斯·切尔尼公开表示,开发者的核心职责是守住代码质量;25 位菲尔兹奖得主联署批评 AI 正在「露天开采」数学。
一、模型:更大与更便宜同时加速
xAI Grok 4.7(2026-09-12):参数规模 2.1 万亿,较 Grok 4.6 的 1.5 万亿增长约 40%。马斯克称新模型除服务速度略慢外各方面优于前代、token 效率更高,并以 SpaceX 工程数据做补充训练以强化真实世界工程任务。
待核实:截至发稿,xAI 官方模型文档仍以 Grok 4.6 为最新,未见 Grok 4.7 的 model card、上下文窗口、定价与 API 标识。参数量与能力口径目前来自马斯克本人及多家日报汇总,上线前请以官方文档为准。
Kimi K2.8 Preview(2026-09-11):全量上线 Kimi Code / Kimi Work,Model ID 仍为 kimi-for-coding,1M 上下文向全部会员档位开放。详见 Kimi K2.8 Preview 全量上线。
DeepSeek V4.1-Flash(2026-09-10):552B MoE、MIT 开源权重、北京时间 9-14 12:00 起接管所有 deepseek-v4-pro 请求。详见 DeepSeek V4.1-Flash 与 V4 Pro 路由切换。
Agnes AI Agnes-3.0-Flash:330 亿参数开源多模态模型,Apache 2.0 许可、262K 上下文,官方称可在单张 H200 或 H100 上运行。
二、成本:同一个模型,账单能差 70 倍
InfoQ 的三组测试给出了本期最实用的一条结论:即便底层模型完全相同,不同 AI 编程工具的实际 token 消耗可以相差 70 倍。
差异不在模型,而在两处:
- Agent 框架的启动开销——每次会话固定注入多少上下文、工具定义是否全量塞进 prompt;
- 缓存命中率——系统提示词与工具定义是否稳定到能被命中。
这直接推翻了「选型 = 比较模型报价」的做法。对团队来说,正确的度量单位是「每个完成任务的成本」,而不是「每百万 token 的单价」。一个便宜但总停在 70% 进度的尝试,会产生人工兜底成本;一个更贵但能跑完、自测、写文档的运行,总成本反而更低。
同一周的 DeepSeek V4.1-Flash 定价也印证了这一点:缓存命中输入 $0.003、未命中 $0.15,相差 50 倍——先把缓存设计好,再谈模型选型。
三、能力:数学「最后高墙」与榜单饱和
GPT-6 Astra 攻克 FrontierMath Tier 4:解出该层级剩余的全部问题,Epoch AI 宣布该层级已饱和;成绩从该层级此前最高的 5% 提升到 97.6%,意味着整套 FrontierMath 已被完整攻克。这件事的连带问题是评测体系本身是否需要更新——当一套基准在一周内从 5% 跳到 97.6%,它的区分度已经失效。
25 位菲尔兹奖得主联署(2026-09-11):陶哲轩、Peter Scholze、吴宝珠、Maxim Kontsevich、James Maynard 等发表《人工智能在数学中的严重错位》(A Severe Misalignment of AI in Mathematics)。核心论点:AI 公司把「解决著名数学难题」当作 benchmark,与数学共同体追求「概念理解与新洞见」的目标严重错位;批量生产缺乏缜密论证的思想会切断人类知识传承链。导火索是 OpenAI 于 9-08 宣布以约 1 万个 Agent 并发、约 88 小时给出纳维-斯托克斯千禧年难题的解答。
四、评测标准:垂类 Agent 与新基准登场
| 事件 | 关键数据 | 来源 |
|---|---|---|
| WPS AI 表格 Agent 登顶 SpreadsheetBench V2 Full | 50.86%,超过 Claude Opus 4.6(34.89%)、GPT-5.2(26.79%)、Gemini 3.1 Pro(23.68%),三个月内第三次登顶 | 观察者网 2026-09-13 |
| 中国信通院发布方升-Code 2.0 | 9-11 于服贸会发布,面向代码生成与智能体协作场景的标准化代码能力评估体系 | 北京商报 2026-09-11 |
| Artificial Analysis 智能指数 v4.2 | 新增 AA-Briefcase(agentic 知识工作)与 Surge AI GDP.pdf(长文档推理),移除已饱和的 GPQA Diamond,私有 held-out 测试权重翻倍至 40% | HeadsUpAI |
值得单独说一句 WPS AI:在通用能力趋同的背景下,垂类 Agent 在细分任务上跑赢国际大厂,说明国产办公 AI 正从模型比拼转向专业场景深耕。这条路径对做垂直工具的团队有参考价值——与其在通用榜单上硬碰,不如在一个可度量的细分任务上做到第一。
五、工程与工具:本地推理、Agent 治理与「代码质量」回归
- Perplexity 开源 Lily:面向 Apple silicon 的本地推理引擎,针对 Qwen3.6-35B-A3B 做算子级映射,官方称在 M5 Max MacBook Pro 上相对 MLX-LM prefill 快 1.23×、decode 快 1.35×,Rust runtime + 自研 Metal kernel。
- Meta Muse Spark 1.3:长程 agentic 与编程任务提升,会主动澄清问题并确认关键操作;内部对比称工具调用减少 20%、token 减少 25%,已在 Muse Code 与 Meta Model API 上线。
- Kiteworks 收购 Bonfy.AI:补强运行时数据分类能力,可识别邮件、文件共享、API 与 AI Agent 流量中的敏感数据——Agent 自主调用接口后,数据流的实时治理正从合规选项变为基础设施。
- Claude Code 之父谈 AI 编程:鲍里斯·切尔尼表示,AI 改变软件开发后,开发者真正要守住的不是亲手写每一行代码,而是代码质量本身;他提到每天都会收到「如何处理 AI 垃圾代码」的来信。
AI 之家 观点
本期四条线索指向同一个转折:2026 下半年的竞争维度,正从「模型更强」扩散到「更便宜、更可控、更可度量」。
- 成本度量单位换了。token 单价已经不足以做选型依据——**框架开销(70 倍差距)与缓存设计(50 倍价差)**才是大头。团队应把「每完成任务的成本」写进监控面板。
- 评测正在失效与重建同时发生。FrontierMath Tier 4 一周内从 5% 到 97.6%、Artificial Analysis v4.2 移除 GPQA Diamond、信通院推出方升-Code 2.0——榜单的半衰期已经短到季度级。任何依赖单一榜单做采购决策的做法都该淘汰。
- 垂类 Agent 的价值被重新发现。WPS AI 表格 Agent 的登顶说明:在一个可度量的细分任务上做到第一,比在通用榜上排第十更有商业价值。
- 工程纪律在回潮。切尔尼那句「守住代码质量」和 25 位菲尔兹奖得主的联署,本质是同一件事:当生成成本趋近于零,判断力与验证能力就成了唯一的稀缺资源。
相关阅读
- 本期深度:DeepSeek V4.1-Flash 与 V4 Pro 路由切换 · Cognition SWE-2 发布 · Kimi K2.8 Preview 全量上线 · 智谱 50 亿美元融资
- 往期周报:AI 编程工具周报 2026-09-13
- 模型卡:Grok 4.6 · GPT-6 Astra · Kimi K3 · DeepSeek V4
- 工具卡:Claude Code · Cursor · Muse Code · Ollama
- 概念:Agentic Coding · SWE-bench · Token 与计费 · Prompt Caching
来源
- 同模型 token 消耗差 70 倍:AI 编程工具的隐性成本黑洞 — InfoQ
- AI 数学最后高墙被打通:GPT-6 Astra 攻克 FrontierMath Tier 4 — 量子位
- 从表格到教育医疗,国产垂类 AI 正跑赢国际大厂?(WPS AI 表格 Agent) — 观察者网
- 方升-Code 2.0 发布,大模型基准测试体系迎来新标准 — 北京商报
- Claude Code 之父切尔尼谈 AI 编程:开发者核心职责是守住代码质量 — IT 之家
- AI Roundup (Sat Sep 12)(Grok 4.7 / K2.8 / 菲尔兹奖联署) — DEV Community
- Biggest AI News This Month (September 2026)(Lily / Muse Spark 1.3 / 智能指数 v4.2) — HeadsUpAI
- AI Weekly:Agnes AI 33B 多模态开源模型 — AI Weekly
- Kiteworks 收购 Bonfy.AI — AI Weekly
- Mecka AI 获红杉领投,机器人训练数据争夺升温 — TechCrunch