跳到主内容

豆包手机助手消费者版发布:SAEP 协议让第三方 App 自声明 AI 操作边界,9 月 16 日随努比亚 NaviX Ultra 开售

2026-09-15 · 证券时报 / 中国新闻网 / 新浪科技 / 中国经济新闻网 / 四川广播电视台

要点

  • 2026-09-14 发布:豆包手机助手消费者版本正式发布,以豆包 App 为基础,与手机厂商在系统层面展开合作。相比去年底的技术预览版,本次更强调稳定性与日常可用性
  • 首款机型:搭载于中兴与字节跳动联合研发的努比亚 NaviX Ultra,定位「全球首款 AI 智能体手机」,已开启预约,9 月 16 日正式发售。此前该机已取得工信部入网许可,完成从大模型备案到终端入网的完整合规流程。
  • 交互:支持语音、专属 AI 键等多种唤醒方式。AI 键带指纹鉴权能力,完成本人验证后无需二次解锁即可调用助手执行任务;语音唤醒针对远场、内噪、嘈杂环境做了优化。
  • 屏幕问答能力:用户无需截图或切换应用,可直接围绕当前屏幕内容提问或将其作为任务输入。官方演示中,用户打开相机对准室内环境说「根据这个装修风格,帮我选一个一米二以内、价格不超过一千元的柜子」,助手即可结合画面信息在电商平台完成筛选推荐。
  • 本地记忆与检索:在用户主动授权前提下,覆盖电话录音、相册、短信、便签等本地数据,提供搜索工具按需检索;支持手动保存当前屏幕内容供后续查找;引入任务排队与插队机制。录音功能接入飞书妙记,支持转录、实时翻译、区分说话人与自动总结,并可检索过往录音具体内容。
  • 任务执行:「豆包智能服务」Beta 版已接入曹操出行、地图等服务,曹操出行首批支持北京、杭州;用户提出打车需求后,助手可确认常用地址、选择车型并发起下单。
  • SAEP 协议:广受关注的「操作手机」功能以 Beta 版形式开放。豆包同步推出屏幕自动化操作声明协议(SAEP, Screen Automation Execution Protocol),并启动为期 30 天的规则公示——第三方应用可自主声明操作边界,明确允许或拒绝 AI 助手在本应用内进行屏幕自动化操作;对明确拒绝的应用,豆包承诺不会进行自动化操作
  • 隐私与安全:数据收集遵循「最小必要」与「用户自主控制」原则,采用端云结合处理方案,建立 Agent 防护体系对可操作范围分层、分级管理,官网提供完整隐私安全白皮书。

后续(2026-09-16 补记):努比亚 NaviX Ultra 已于 09-16 14:00 正式发布,硬件与量产信息同步公布——骁龙 8 Elite Gen5512GB 起步存储、2 亿像素摄像头、7100mAh 电池、7.62mm 机身,侧边设带指纹识别的独立橙色 AI 实体按键;搭载长鑫 10667Mbps LPDDR5X(该速率国产内存首次量产应用)。官方强调模型核心运算在本机本地执行、数据不必上传云端,并具备生成式 AI 备案资质。市场热度方面,截至 09-15 京东平台预约量突破 36 万台(另有口径为 36.9 万)。最终售价与完整配置以发布会公布为准。完整梳理见 努比亚 NaviX Ultra 发布:全球首款 AI 智能体手机

背景与分析

这条新闻里,真正有行业价值的不是「手机助手能打车」,而是 SAEP 协议

GUI 智能体(图形界面智能体)的技术路径是「看着屏幕替用户操作」:识别页面上的文字、按钮和输入框,再模拟点击、滑动、输入,逐步完成任务。它沿用了人类操作 App 的流程,好处是无需 App 主动适配,坏处是三个老问题:

  1. 页面一变就崩——UI 改版、A/B 测试、弹窗广告都会让既定操作路径失效。
  2. 授权边界模糊——助手到底能在哪些 App 里点什么,此前完全由助手单方面决定。
  3. 责任归属不清——AI 误操作造成的损失,算助手的、算 App 的、还是算用户的?

SAEP 想解决的是第 2 和第 3 条。它把「能否被自动化操作」变成 App 侧可声明的元数据:开发者在自己的应用里声明允许/拒绝,助手据此执行。这个设计的聪明之处在于——它没有要求 App 改造接口,只要求 App 表态。对第三方开发者来说成本极低,对豆包来说则把「擅自操作他人 App」的法律与舆论风险,转移成了「尊重开发者意愿」的合规姿态。

但要清醒地看到局限:这是一份自律协议,不是技术标准,更不是强制约束。 30 天规则公示只是公示。真正决定它成败的是两件事:主流 App 的参与率,以及拒绝自动化后豆包是否真的完全不碰。目前官方口径是「充分尊重开发者意愿」,执行情况待观察。

另一个值得注意的信号是 屏幕问答能力。豆包把它做成了「相机对准 → 语音提问 → 跨平台完成筛选」,这实际上是多模态输入 + 跨应用执行的组合。苹果在 Siri 与 Apple Intelligence 的演示里展示过类似的屏幕上下文理解能力——手机 AI 助手正从「回答问题」转向「理解你所在的场景并替你完成任务」。这个转向一旦成立,App 的分发入口会被助手层截流,这才是各家都在抢的真实战场。

最后提醒一点:「全球首款 AI 智能体手机」是厂商宣传口径。从公开信息看,NaviX Ultra 的核心差异化在于系统级集成深度(AI 键、本地数据授权、服务接口调用),而非底层模型能力——它用的是豆包大模型,模型本身并非独家。

对开发者的影响

  • App 开发者要开始考虑「对 Agent 的姿态」了。SAEP 目前只覆盖豆包生态,但方向很明确:未来你的 App 需要声明「是否允许 AI 助手代操作」。建议尽早想清楚:哪些流程欢迎自动化(比价、下单、填表),哪些必须拒绝(支付确认、隐私设置、不可逆操作)。
  • GUI 自动化不能当主力方案,只能当兜底。页面一变就崩是结构性问题。有 API 就走 API,GUI 只用于没有接口的场景。这个判断对做 CursorClaude Code 这类桌面/编辑器 Agent 同样成立——可访问性树(a11y tree)比像素识别稳得多
  • 本地数据授权会成为新的隐私战场。相册、短信、通话录音能被检索,体验提升是真的,风险也是真的。涉及敏感数据的场景,优先选端侧处理方案,并确认厂商是否提供「端云结合」中哪些环节在端上的明确说明。
  • 移动 Agent 的分发逻辑在变。如果助手层截流了入口,App 的竞争力会从「用户主动打开」转向「被 Agent 正确调用」。结构化、可被机器理解的服务描述(类似 skills / MCP 的思路)会变得重要。
  • 别急着把 GUI Agent 接进关键业务。Beta 版 + 30 天公示期意味着规则还在变。等非关键场景跑够三个月再谈核心链路。

AI 之家 观点

  1. SAEP 是这一步棋里最有价值的部分,但它本质上是一份「行业自律倡议」。 豆包很清楚 GUI 智能体最大的阻力不是技术,是生态合法性。用一份低成本的声明协议把第三方拉进来,比跟每个 App 单独谈接口现实得多。真正的考验在 30 天公示之后——有多少主流 App 会真的去声明
  2. 「AI 智能体手机」这个品类,胜负手在系统集成深度,不在模型。 模型大家都能接,但 AI 键的指纹鉴权、本地数据的授权检索、服务接口的直连调用,这些需要手机厂商配合的能力才是壁垒。这也是字节选择与中兴努比亚联合研发,而不是自己造手机的原因。
  3. 对开发者最现实的启示:Agent 时代,「可被机器正确调用」正在变成一种产品能力。 过去我们优化给用户看,接下来要同时优化给 Agent 看——清晰的结构、稳定的选择器、明确的权限边界。这一点在 Web 和移动端是同一个道理。

相关阅读

来源

本资讯由 AI 之家 编辑部根据公开报道整理,非字节跳动官方通稿。SAEP 协议处于 30 天规则公示期,最终规则以豆包官方公布为准;「全球首款 AI 智能体手机」为厂商宣传口径。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

相关评测