跳到主内容
AIHO 2026 全新改版上线
multimodalGoogle DeepMind

Google Gemini Robotics

Google DeepMind 基于 Gemini 2.0 的机器人多模态模型家族,能把自然语言指令和摄像头画面直接转成机器人动作;2026 年进一步推出 On-Device 本机推理版本,让模型跑在机器人自己身上。

发布 2026-07-23更新 2026-07-23

规格

厂商
Google DeepMind
发布日期
2025/3/25
类型
multimodal
上下文窗口
1000K tokens
最大输出
8K tokens
定价
通过 Vertex AI / Google AI Studio 按 Gemini 2.0 计价;机器人定制版为企业授权,具体以官方为准
API 兼容
google

基准测试

优于传统分层控制(定性)
语言指令零样本泛化
显著低于云端往返(On-Device 版)
本机推理延迟

✓ 优势

  • 基于 Gemini 2.0 多模态底座,原生理解图像/视频/语言
  • 能现场生成机器人控制代码(code generation on the fly),不需为每个场景预编程
  • On-Device 本机本地推理版本,断网也能跑,延迟低、鲁棒性强
  • 与 Google 生态(AndroidXR / Project Astra)协同,面向消费级机器人场景

⚠ 不足

  • 国内无官方直连,需 Vertex AI 或中转
  • 真实开放世界长尾任务仍弱于专用运控
  • 本机推理对机器人端算力(如 Jetson 级)有门槛

适用场景

未知场景的零样本操作(没训练过的指令也能尝试)仓储 / 工厂的非结构化抓取与分拣家庭 / 服务场景的语义级交互(说人话就能指挥)作为'大脑'驱动波士顿动力 Atlas 等本体

概述

Gemini Robotics 是 Google DeepMind 把 Gemini 多模态能力"装进机器人身体"的成果。它解决的核心问题是:让机器人听懂一句人话 + 看懂眼前画面,然后自己决定怎么动——而不是工程师为每一个动作预先写死控制代码。

基于 Gemini 2.0 的视觉-语言底座,它能做到两件传统机器人做不到的事:

  1. 现场生成控制代码:面对没专门编程过的场景,模型即时产出可执行的机器人指令;
  2. 本机本地推理(On-Device):2026 年推出的 Gemini Robotics On-Device 把模型直接跑在机器人自身的算力上,断网也能工作,延迟更低、在真实部署里更稳。

核心能力

多模态"大脑"

和纯运控机器人不同,Gemini Robotics 继承了 Gemini 对图像、视频、语言的原生理解。你用自然语言下指令,它结合摄像头画面做语义决策——这正是 VLA 模型 想达成的"端到端统一"。

生成式控制(code on the fly)

最被看重的特性是:模型能为新任务实时生成控制代码。这意味着"教机器人做一件新事"从"养团队半年"变成"说一句话",是 机器人基础模型 泛化能力的直接体现。

On-Device 本地推理

云端推理在工厂 / 家庭里有两个致命问题:延迟、断网即瘫。Gemini Robotics On-Device 把模型下沉到机器人端,是 2026 年具身智能从 demo 走向部署的关键一步(同类思路也见于 NVIDIA Jetson Thor)。

在产业里的落点

  • 波士顿动力 Atlas:2026 年进入量产的新一代 Atlas 集成了 Google Gemini,作为"大脑"驱动决策;
  • 研究生态:作为开放能力被多家机器人本体与高校采用,与 NVIDIA GR00T、Figure Helix 同列 2026 年主流技术路线之一。

与其他机器人模型的定位差异

维度Gemini RoboticsNVIDIA Isaac GR00TFigure Helix
主体定位模型 + 生态开放基础模型 + 全栈工具链双系统本体智能
强项多模态理解 + 生成控制代码跨本体训练 + 仿真 + Scaling Law双机协作、动态环境
推理位置云端 / 本机 On-Device本机(Jetson Thor)本机
开放度企业授权为主开放权重 + 工具链闭源

国内使用

与所有 Google 模型一样,Gemini Robotics 在大陆无官方直连,需 Vertex AI 或中转,且机器人本体侧还要解决端算力与部署合规。研究团队多用海外云 + 真机 / 仿真(Isaac Sim)组合。

延伸阅读