2026 年 7 月 AI 编程动态:GPT-5.6 登场、Cursor 换血,行业集体忙着装'护栏'
2026-07-23 · Dreaming.press / Neodrop / SDD 综合
要点
- GPT-5.6 登场(7-09):Sol / Terra / Luna 取代 GPT-5.5 时代,新增 Programmatic Tool Calling、多 agent beta、Ultra 模式(默认 4 并行、可配 16)
- Cursor Grok 4.5(7-08):跨桌面/Web/iOS/CLI/SDK,号称用 Cursor 代码库交互数据训练;Cursor 3.0 用 Agents Window 取代旧布局
- Claude Code:Sonnet 5 于 6-30 成默认模型,Fable 5 于 7-01 全球恢复;v2.1.206 默认开启云上 auto mode、新增
/commit-push-pr - 护栏周(7-06~11):Codex CLI 加 writes 审批、OpenHands 加 Budgets、Zed 加本地 llama.cpp——主题清一色"治理"
- 格局变动:Windsurf 被 Cognition 收编为 Devin Desktop;Amazon Q 向 Kiro 过渡;Copilot 6-01 起改用量计费;OpenAI 公开退出 SWE-bench Verified
本文为 AIHO 基于 Dreaming.press、Neodrop、SDD、AgentsIndex 等 2026-07 公开报道的整合整理。
一、GPT-5.6:重排 agent 技术栈
7 月 9 日,OpenAI 发布 GPT-5.6 三款模型 Sol / Terra / Luna,取代 GPT-5.5 时代。同步推出:
- Programmatic Tool Calling:结构化、可编排的工具调用;
- 多 agent beta:内置多 agent 协作;
- Ultra 模式:默认 4 个并行 agent,可配置至 16 个。
Devin Desktop / CLI 同日接入三款模型,GitHub Copilot 在 IDE / CLI / Web / 云 agent / 移动端全面暴露 GPT-5.6 Sol/Terra/Luna;GitHub 还把 Kimi K2.7 Code 加进 Business / Enterprise,逼着管理员开始思考"开源权重模型怎么进企业策略"。
编程基准上,GPT-5.6 在 Terminal-Bench 系列保持领先(模型卡 官方 2.1 口径 Sol 达 91.9%);第三方 2026-07 实测另给 Terminal-Bench 2.0 口径 85.6%,并指其 SWE-bench Pro 仅 64.1%,落后同期 Claude Opus 4.8 的 69.2%。
二、Cursor:换模型、换界面
Cursor 7 月 8 日上线 Grok 4.5,覆盖桌面/Web/iOS/CLI/SDK,官方称用"数万亿 token 的 Cursor 代码库与开发者-agent 交互数据"训练。有意思的是,Cursor 在 Grok 4.5 评估中排除了 CursorBench——因为早期 Cursor 代码库快照意外混入了训练数据。这给所有人提了个醒:接受任何厂商的 coding-agent 分数前,先问 benchmark 数据干净不干净。
界面侧,Cursor 3.0 用 Agents Window 取代旧布局,云 agent 移出 Editor,Side Chats(/side、/btw)可开持久 agent 会话并回 @ 主线程,还加了 Cmd+K 转录搜索、五个云 agent hooks。
三、Claude Code:安静地变"自主"
6 月 30 日,Sonnet 5 悄然取代 Sonnet 4.8 成为 Claude Code 与各 Claude 套餐默认模型(无发布会,只有 changelog),原生 1M 上下文。Fable 5 因出口管制 6-12 下线、7-01 恢复。
v2.1.205–207 的变化更实质:auto mode 在 Bedrock / Vertex / Foundry 上默认开启(不想自主就显式 disableAutoMode);新增 /commit-push-pr 推送自动化、/doctor 可修剪 CLAUDE.md、/cd 路径建议、外部 worktree 确认、升级后自动后台 agent 更新。默认假设已从"人盯着"切到"云上自主运行"。
四、"护栏周":行业集体装刹车
7 月 6–11 日这一周,Codex、OpenHands、Claude Code、Zed 同一周发版,几乎没有一条是关于"写更好代码"的,全是审批、预算、运行边界:
| 工具(版本) | 装了什么"刹车" |
|---|---|
| Codex CLI v0.144.x(7-09) | writes 审批模式(只读免打扰、写才弹确认)+ 交互式 MCP 认证 |
| OpenHands v1.11.0(7-09) | Budgets 仪表盘 + Agent Profiles + BYO-key |
| Claude Code v2.1.205–207 | 云上 auto mode 默认开,agent-teams 崩溃循环修复 |
| Zed v1.10.2(7-10) | llama.cpp 本地模型 provider,agent 完全跑在自己机器上 |
一句话总结这周:前沿从"它能不能写"移到了"你能不能放心让它无人值守地跑"。而 fire-and-forget 只有在刹车(审批范围、成本上限、BYO-key、本地选项)齐备时才成立。
五、格局:合并、退场、计费变天
- Windsurf 被 Cognition 收购,以 Devin Desktop 名义重启;
- Amazon Q Developer 进入向 Kiro 接班的下坡路;
- GitHub Copilot 2026-06-01 起从包月切到按 AI Credits 用量计费,平价时代结束;
- OpenAI 公开退出 SWE-bench Verified——这个半数榜单还在引用的基准,公信力被自己人抽走。
AIHO 观点
2026 年 7 月最值得记的,不是哪个模型又高了几个点,而是整个赛道在用同一个动作表态:把 agent 从"演示玩具"升级为"可托付的生产系统"。审批模式、成本仪表盘、本地选项——这些不性感,却是从"能跑"到"敢让它跑"的必经之路。这正呼应 Agentic Coding 在 2026 年从"马力"转向"护栏"的主线。
相关阅读
- 概念:Agentic Coding / Vibe Coding
- 工具:Claude Code / Codex CLI / Cursor / OpenHands
- 模型:GPT-5.6
- 跨域呼应:具身智能(Agent 从数字走向物理)