方法论VLAVision-Language-Action具身智能机器人扩散策略RT-2
VLA 模型(视觉-语言-动作)
Vision-Language-Action 模型:把'看(视觉)''懂(语言)''做(动作)'端到端统一到一个模型里,是具身智能的核心技术路线,被誉为'机器人的 ChatGPT 时刻'。
发布 2026-07-23更新 2026-07-23什么是 VLA 模型
VLA(Vision-Language-Action,视觉-语言-动作)模型 是一种把"视觉感知、语言理解、动作生成"三者端到端统一在同一个神经网络里的具身智能模型。你给它一张摄像头画面 + 一句自然语言指令("把红色方块放到蓝色碗里"),它直接输出机器人关节的动作序列——中间没有手写的状态机,也没有分模块拼接。
它为什么被称作"机器人的 ChatGPT 时刻"?因为 ChatGPT 证明了"一个统一大模型 + 海量数据"能泛化到无数没见过的文本任务;VLA 想对物理动作做同样的事——一个模型,靠数据喂出来,就能处理没专门编程过的操作。
典型结构:VLM 骨干 + 扩散动作头
主流 VLA 基本是"两段式"架构:
[摄像头图像 + 语言指令]
↓
VLM 骨干(视觉-语言模型,如 Gemini / InternVL)
↓ 输出:任务语义表示(token 流 / 嵌入)
动作专家(Action Expert)
├─ 扩散模型(Diffusion Policy):去噪生成连续动作轨迹
└─ 或离散化动作 token:自回归预测下一步动作
↓
[关节角度 / 末端执行器位姿 / 夹爪开合]
- VLM 骨干负责"看懂场景 + 听懂指令",复用的是多模态大模型的能力;
- 动作头负责"怎么动",业界主流用**扩散策略(Diffusion Policy)**生成平滑、连续的轨迹,比直接回归一个坐标稳得多。
代表模型(2025–2026)
| 模型 | 机构 | 特点 |
|---|---|---|
| RT-2 | Google DeepMind | 最早把"视觉-语言"预训练知识迁移到动作的探索者之一,泛化性强 |
| OpenVLA | 社区开源 | 开放权重的 VLA 基线,降低了研究门槛 |
| π0(Pi-Zero) | Physical Intelligence | 流式动作专家,主打灵巧手复杂操作 |
| Helix | Figure AI | 双系统(感知-语义 + 实时运控),实现双机协作未知环境操作 |
| GR00T | NVIDIA | 开放人形基础模型,配 Cosmos 仿真 + Newton 物理引擎,主打"可定制" |
| Gemini Robotics | Google DeepMind | 基于 Gemini 2.0,能现场生成机器人控制代码,并支持本机本地运行 |
| WVLA 2.0 | 宇树 | 量产数据反哺,已落地 G1 会议室自主整理等场景 |
VLA 与传统分层控制的区别
| 维度 | 传统分层(感知→规划→控制) | VLA 端到端 |
|---|---|---|
| 改动成本 | 换任务要重调规则 / 重训控制器 | 自然语言切换,模型泛化 |
| 未知场景 | 容易失败(没写过的就崩) | 靠语义理解兜底,鲁棒性更高 |
| 可解释性 | 高(每一步可读) | 低(黑盒动作) |
| 数据需求 | 低(规则主导) | 高(要大量演示 / 仿真数据) |
| 实时性 | 高 | 依赖算力,本机推理是趋势 |
所以当下工业落地多是混合路线:VLA 做高层语义决策,传统运控做底层稳定执行。
当前难点
- 数据稀缺:真实机器人演示数据远少于互联网文本/图像,仿真(如 NVIDIA GR00T-Dreams)能补约 40% 成功率,但长尾仍靠真实数据;
- 本机算力:云端推理有延迟、断网即瘫,所以 Gemini Robotics On-Device、Jetson Thor 这类边端推理成为 2026 重点;
- 安全与越界:端到端模型难加硬约束,工业场景需要"动作范围 / 力控上限"的可验证护栏;
- 长程任务漂移:多步操作里一步错容易连锁翻车,需要世界模型做"想象-验证"回环。
VLA 与世界模型、机器人基础模型的关系
- VLA 解决"看到指令 → 怎么动";
- 机器人基础模型 是更广义的"在海量多本体数据上预训练、可零样本泛化"的底座,VLA 常是它的一个实例化形态;
- 世界模型(如 NVIDIA Cosmos、Google Genie)补上"在脑内模拟下一步会发生什么",让 agent 能先想后动。
三者叠起来,才接近"通用具身智能"。
延伸阅读
- 上位概念:具身智能
- 能力底座:机器人基础模型
- 代表实现:Google Gemini Robotics / NVIDIA Isaac GR00T
- 同源数字智能:AI Agent / Function Calling