跳到主内容
AIHO 2026 全新改版上线
方法论VLAVision-Language-Action具身智能机器人扩散策略RT-2

VLA 模型(视觉-语言-动作)

Vision-Language-Action 模型:把'看(视觉)''懂(语言)''做(动作)'端到端统一到一个模型里,是具身智能的核心技术路线,被誉为'机器人的 ChatGPT 时刻'。

发布 2026-07-23更新 2026-07-23

什么是 VLA 模型

VLA(Vision-Language-Action,视觉-语言-动作)模型 是一种把"视觉感知、语言理解、动作生成"三者端到端统一在同一个神经网络里的具身智能模型。你给它一张摄像头画面 + 一句自然语言指令("把红色方块放到蓝色碗里"),它直接输出机器人关节的动作序列——中间没有手写的状态机,也没有分模块拼接。

它为什么被称作"机器人的 ChatGPT 时刻"?因为 ChatGPT 证明了"一个统一大模型 + 海量数据"能泛化到无数没见过的文本任务;VLA 想对物理动作做同样的事——一个模型,靠数据喂出来,就能处理没专门编程过的操作。

典型结构:VLM 骨干 + 扩散动作头

主流 VLA 基本是"两段式"架构:

[摄像头图像 + 语言指令]
        ↓
   VLM 骨干(视觉-语言模型,如 Gemini / InternVL)
        ↓ 输出:任务语义表示(token 流 / 嵌入)
   动作专家(Action Expert)
   ├─ 扩散模型(Diffusion Policy):去噪生成连续动作轨迹
   └─ 或离散化动作 token:自回归预测下一步动作
        ↓
   [关节角度 / 末端执行器位姿 / 夹爪开合]
  • VLM 骨干负责"看懂场景 + 听懂指令",复用的是多模态大模型的能力;
  • 动作头负责"怎么动",业界主流用**扩散策略(Diffusion Policy)**生成平滑、连续的轨迹,比直接回归一个坐标稳得多。

代表模型(2025–2026)

模型机构特点
RT-2Google DeepMind最早把"视觉-语言"预训练知识迁移到动作的探索者之一,泛化性强
OpenVLA社区开源开放权重的 VLA 基线,降低了研究门槛
π0(Pi-Zero)Physical Intelligence流式动作专家,主打灵巧手复杂操作
HelixFigure AI双系统(感知-语义 + 实时运控),实现双机协作未知环境操作
GR00TNVIDIA开放人形基础模型,配 Cosmos 仿真 + Newton 物理引擎,主打"可定制"
Gemini RoboticsGoogle DeepMind基于 Gemini 2.0,能现场生成机器人控制代码,并支持本机本地运行
WVLA 2.0宇树量产数据反哺,已落地 G1 会议室自主整理等场景

VLA 与传统分层控制的区别

维度传统分层(感知→规划→控制)VLA 端到端
改动成本换任务要重调规则 / 重训控制器自然语言切换,模型泛化
未知场景容易失败(没写过的就崩)靠语义理解兜底,鲁棒性更高
可解释性高(每一步可读)低(黑盒动作)
数据需求低(规则主导)高(要大量演示 / 仿真数据)
实时性依赖算力,本机推理是趋势

所以当下工业落地多是混合路线:VLA 做高层语义决策,传统运控做底层稳定执行。

当前难点

  1. 数据稀缺:真实机器人演示数据远少于互联网文本/图像,仿真(如 NVIDIA GR00T-Dreams)能补约 40% 成功率,但长尾仍靠真实数据;
  2. 本机算力:云端推理有延迟、断网即瘫,所以 Gemini Robotics On-Device、Jetson Thor 这类边端推理成为 2026 重点;
  3. 安全与越界:端到端模型难加硬约束,工业场景需要"动作范围 / 力控上限"的可验证护栏;
  4. 长程任务漂移:多步操作里一步错容易连锁翻车,需要世界模型做"想象-验证"回环。

VLA 与世界模型、机器人基础模型的关系

  • VLA 解决"看到指令 → 怎么动";
  • 机器人基础模型 是更广义的"在海量多本体数据上预训练、可零样本泛化"的底座,VLA 常是它的一个实例化形态;
  • 世界模型(如 NVIDIA Cosmos、Google Genie)补上"在脑内模拟下一步会发生什么",让 agent 能先想后动。

三者叠起来,才接近"通用具身智能"。

延伸阅读