跳到主内容

AI 编程日报 2026-09-15:安全补丁周、Coder Agent Relay 打通受监管行业,以及一批静默改掉的默认值

2026-09-15 · DEV Community / Gemini CLI GitHub Releases / Oday Bakkour / IT Brief UK / 至顶科技

要点

安全(本周主线)

  • Gemini CLI v0.59.0(09-08):修复 MCP OAuth 元数据发现与认证过程中的 SSRF(PR #29081);强制 fail-closed 工作区信任并在受限模式下过滤 mcpServers 配置(PR #29099)。纯安全版本,无新功能。
  • Claude Code 2.1.268:修复两条 deny 规则绕过——此前针对 /tmp/var 这类符号链接路径写的拒绝规则不生效;同时 /mcpclaude mcp list 不再打印从 ${VAR} 占位符解析出的密钥
  • Codex CLI 0.154.0破坏性变更——已废弃的 codex mcp-server 入口被移除;启动流程改为在建立信任前不运行工作区可控的辅助脚本;macOS 沙箱阻止终端输入注入

部署模式

  • Coder Agent Relay(private preview,SpaceXAI 为首发合作伙伴):Cursor 云智能体可在客户自有基础设施的 Coder 工作空间内运行。推理与规划仍在 Cursor 云端,工具调用在客户网络内执行,源码、密钥与内部服务不出客户机器。支持气隙(air-gapped)部署

静默变化的默认值

  • Cline v4.1.1757 家供应商的默认模型被更换,Anthropic 默认从 Claude Opus 5 改为 Claude Fable 5.1;模型目录新增 10 家供应商(含 Bothub、OpenReason、SenseNova、TokenGo、TokenRouter、Vancine、Volcengine Ark)。
  • Codex CLI 0.154.0GPT-6 Astra 进入模型选择器与 Amazon Bedrock 目录。
  • OpenCode v1.18.30:为 GPT-6 系列新增 Astra 系统提示词,修复 Bedrock DeepSeek 模型 ID 解析。

生态

  • AWS Pizza Bot:开源自托管的后台 Agent 收件箱,基于 DeepAgents + LangGraph,支持 MCP、持久化任务状态、审批控制与定时工作流。

背景与分析

一、安全:三家 CLI 同周收紧,MCP 成了新的攻击面

这周最值得注意的不是任何单个 CVE,而是三家在同一周修同一类问题

共同点是 MCP 与工作区信任的交互。MCP 让 CLI 能动态加载外部工具服务器,但「从哪个工作区加载哪些服务器、用什么凭据认证」此前相当宽松。Gemini CLI 的 SSRF 出在 OAuth 元数据发现阶段——恶意构造的元数据链接可以让 CLI 替攻击者向内网发请求;配合「克隆个仓库就直接开跑」的习惯,攻击链是完整的。

fail-closed(失败即拒绝)这个词值得记住:它指在无法确定是否允许时一律拒绝,与 fail-open 相反。Gemini CLI 现在对未信任工作区默认拒绝,且在受限模式下根本不加载 mcpServers

Claude Code 那个 deny 规则绕过更隐蔽——很多人写规则时用 /tmp/var,而在 macOS 上这些是符号链接(真实路径 /private/tmp),规则因此失效。这类「规则写了但没生效」的问题,比没有规则更危险,因为它给你虚假的安全感。

Codex 的「建立信任前不运行工作区可控脚本」是同一思路:在你确认信任这个仓库之前,别执行仓库里的任何东西。这条应该成为所有 Agent CLI 的默认值。

二、部署模式:企业不是拒绝 Agent,是拒绝「代码跑在哪」

Coder CEO Rob Whiteley 的一句话把这事说透了:

「企业从来没有拒绝 AI 智能体,它们拒绝的是部署模式。模型从来不是瓶颈。真正把这些挡在生产环境之外的是试点之后的一切——代码在哪跑、谁有访问权限、Agent 能够到什么、事后留下什么记录。这些都是基础设施问题。」

Coder Agent Relay 的做法是把用户体验和执行环境拆开:开发者照常用 Cursor 的 App / Web / 移动端,推理与规划在云端,而工具调用发生在客户网络内的 Coder 工作空间。配套控制包括:沙箱化、临时的单任务 Agent 环境;集中定义可用模型与数据源策略;完整记录 Agent 访问、执行、修改与被阻止的动作;统一的出口网络策略;支持气隙部署。

目标客群很明确:银行、生命科学、国防、航空航天、政府

顺带一个有意思的数据点:Whiteley 说「在 Coder 内部,1% 的工程师占了 40% 的 Token 支出」,但他强调问题不在花了多少钱,而在技术采用的不均衡——「有产者」与「无产者」的差距在拉大。他对「鼓励工程师最大化用 AI」这个做法的评价是:出发点对,指标错了——把 token 花费当指标容易被人为操纵。

这个观察对国内团队同样成立:用「人均 token 消耗」考核 AI 落地,只会奖励烧钱的人。

三、默认值:Cline 一次换掉 57 家供应商的默认模型

这条最容易被忽略,但影响面最广。Cline 是 BYOK 模式——用户接自己的 API,所以「默认模型」决定了大量不细看配置的用户实际在用哪个模型、付多少钱。Anthropic 默认从 Opus 5 换成 Fable 5.1,意味着成本和延迟结构都变了

同类变化这周还有:Codex 把 GPT-6 Astra 放进模型选择器,OpenCode 给 GPT-6 换了 Astra 系统提示词。

这不是第一次,也不会是最后一次。 上一轮 DeepSeek 把 deepseek-v4-pro 静默切到 V4.1-Flash、Kimi 把 kimi-for-coding 无感升级到 K2.8——「模型名」正在集体失去稳定性

四、生态:后台 Agent 缺的是「收件箱」

AWS 的 Pizza Bot 看似玩具,实则补的是一个真空:后台 Agent 跑起来之后,谁来派活、谁来看进度、谁在关键动作前点同意?目前多数团队是自己写队列和审批界面。Pizza Bot 基于 DeepAgents + LangGraph,把持久化任务状态、MCP 集成、审批控制、定时工作流打包成一个自托管收件箱。

这说明后台 Agent 的基础设施层正在从零散走向标准化。

对开发者的影响

  • 今天就升级 Gemini CLI 与 Claude Code。SSRF 出在认证路径、deny 规则静默失效——这两类都属于「不要等下个例行窗口」的修复。用 Gemini CLI 接了任何走 OAuth 的远程 MCP 服务器的,优先处理。
  • 检查你的 deny 规则里有没有符号链接路径。写了 /tmp/var 的,升级到 Claude Code 2.1.268+ 后重新验证一遍是否真的拦住了
  • 用第三方端点(ANTHROPIC_BASE_URL)的,别停在 Claude Code 2.1.265–2.1.267。官方明确提示这段版本有问题。
  • 升级 Codex 前先 grep 一遍 codex mcp-servercodex mcp-server 入口已被移除,脚本、服务定义、编辑器集成里如果有调用,升级即中断
  • Cline 用户去看一眼默认模型。如果你没显式指定模型,v4.1.17 之后你实际用的可能已经不是原来那个了——账单和延迟都会变
  • 受监管行业的团队,可以开始评估 Coder Agent Relay 这类「执行下沉」方案。目前是 private preview,但方向是对的:把「AI 能不能用」的争论,转成「代码在哪跑」的工程问题。
  • 别再用 token 消耗考核 AI 落地。1% 的人烧掉 40% 的配额,说明平均值没有意义。去看任务完成率与返工率

AI 之家 观点

  1. 2026 下半年 Agent 工程的第一主题是「安全面收敛」,不是能力扩张。 三家 CLI 同周修权限与注入,不是巧合——MCP 把「动态加载外部工具」变成标配的同时,也把工作区信任提升成了一等公民问题。建议所有做 Agent 的团队,现在就把「信任边界」画成一张图:哪些配置来自仓库、哪些来自用户、哪些来自远程服务器,三者的优先级必须显式定义。参见 MCP上下文工程
  2. 「部署模式」正在取代「模型能力」成为企业采购的决策点。 Coder 的判断是对的:模型是商品,执行环境是资产。谁能把「代码不出内网 + 全链路可审计 + 策略集中下发」做成开箱即用,谁就吃下银行、国防、政府这块最肥也最难的市场。国内做私有化交付的团队,这是个明确的机会窗口。
  3. 「静默改默认值」正在成为行业默认动作,必须建立反制机制。 Cline 一次换 57 家、DeepSeek 静默路由、Kimi 无感升级——厂商的默认行为变化不会主动通知到你。可行的做法只有一条:把关键路径的回归评测固化成定时任务,用结果变化倒推上游变更,而不是等 changelog。

相关阅读

来源

本资讯由 AI 之家 编辑部根据各项目官方 changelog 与公开报道整理,版本号与修复条目以各项目 GitHub Releases 为准;Coder Agent Relay 处于 private preview 阶段,功能与可用性以官方为准。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Aider vs OpenCode:两个开源终端 Agent,选哪个?2026 对比

Aider 与 OpenCode 2026 选型对比:两者都是开源终端 agent、都支持换模型,但 Aider 以 Git-native 工作流与成熟的多语言支持见长,OpenCode 主打模型无关、本地优先与终端交互体验。从 6 个维度给出明确取舍建议。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

相关评测