[{"data":1,"prerenderedAt":408},["ShallowReactive",2],{"header-counts":3,"footer-counts":6,"wiki-vla":9},{"tools":4,"reviews":5},78,26,{"tools":4,"reviews":5,"playbooks":7,"news":8},22,24,{"id":10,"title":11,"body":12,"category":388,"cover":389,"description":56,"extension":390,"lastVerified":389,"meta":391,"navigation":392,"path":393,"published":394,"relatedModels":395,"relatedTools":398,"seo":399,"slug":400,"stem":401,"summary":402,"tags":403,"updated":394,"__hash__":407},"wiki\u002Fwiki\u002Fvla.md","VLA 模型（视觉-语言-动作）",{"type":13,"value":14,"toc":377},"minimark",[15,20,32,39,43,46,57,73,77,190,194,266,273,276,307,311,334,337,340],[16,17,19],"h2",{"id":18},"什么是-vla-模型","什么是 VLA 模型",[21,22,23,27,28,31],"p",{},[24,25,26],"strong",{},"VLA（Vision-Language-Action，视觉-语言-动作）模型"," 是一种把\"视觉感知、语言理解、动作生成\"三者端到端统一在同一个神经网络里的具身智能模型。你给它一张摄像头画面 + 一句自然语言指令（\"把红色方块放到蓝色碗里\"），它直接输出机器人关节的",[24,29,30],{},"动作序列","——中间没有手写的状态机，也没有分模块拼接。",[21,33,34,35,38],{},"它为什么被称作\"机器人的 ChatGPT 时刻\"？因为 ChatGPT 证明了\"一个统一大模型 + 海量数据\"能泛化到无数没见过的文本任务；VLA 想对",[24,36,37],{},"物理动作","做同样的事——一个模型，靠数据喂出来，就能处理没专门编程过的操作。",[16,40,42],{"id":41},"典型结构vlm-骨干-扩散动作头","典型结构：VLM 骨干 + 扩散动作头",[21,44,45],{},"主流 VLA 基本是\"两段式\"架构：",[47,48,53],"pre",{"className":49,"code":51,"language":52},[50],"language-text","[摄像头图像 + 语言指令]\n        ↓\n   VLM 骨干（视觉-语言模型，如 Gemini \u002F InternVL）\n        ↓ 输出：任务语义表示（token 流 \u002F 嵌入）\n   动作专家（Action Expert）\n   ├─ 扩散模型（Diffusion Policy）：去噪生成连续动作轨迹\n   └─ 或离散化动作 token：自回归预测下一步动作\n        ↓\n   [关节角度 \u002F 末端执行器位姿 \u002F 夹爪开合]\n","text",[54,55,51],"code",{"__ignoreMap":56},"",[58,59,60,67],"ul",{},[61,62,63,66],"li",{},[24,64,65],{},"VLM 骨干","负责\"看懂场景 + 听懂指令\"，复用的是多模态大模型的能力；",[61,68,69,72],{},[24,70,71],{},"动作头","负责\"怎么动\"，业界主流用**扩散策略（Diffusion Policy）**生成平滑、连续的轨迹，比直接回归一个坐标稳得多。",[16,74,76],{"id":75},"代表模型20252026","代表模型（2025–2026）",[78,79,80,96],"table",{},[81,82,83],"thead",{},[84,85,86,90,93],"tr",{},[87,88,89],"th",{},"模型",[87,91,92],{},"机构",[87,94,95],{},"特点",[97,98,99,113,126,139,152,165,177],"tbody",{},[84,100,101,107,110],{},[102,103,104],"td",{},[24,105,106],{},"RT-2",[102,108,109],{},"Google DeepMind",[102,111,112],{},"最早把\"视觉-语言\"预训练知识迁移到动作的探索者之一，泛化性强",[84,114,115,120,123],{},[102,116,117],{},[24,118,119],{},"OpenVLA",[102,121,122],{},"社区开源",[102,124,125],{},"开放权重的 VLA 基线，降低了研究门槛",[84,127,128,133,136],{},[102,129,130],{},[24,131,132],{},"π0（Pi-Zero）",[102,134,135],{},"Physical Intelligence",[102,137,138],{},"流式动作专家，主打灵巧手复杂操作",[84,140,141,146,149],{},[102,142,143],{},[24,144,145],{},"Helix",[102,147,148],{},"Figure AI",[102,150,151],{},"双系统（感知-语义 + 实时运控），实现双机协作未知环境操作",[84,153,154,159,162],{},[102,155,156],{},[24,157,158],{},"GR00T",[102,160,161],{},"NVIDIA",[102,163,164],{},"开放人形基础模型，配 Cosmos 仿真 + Newton 物理引擎，主打\"可定制\"",[84,166,167,172,174],{},[102,168,169],{},[24,170,171],{},"Gemini Robotics",[102,173,109],{},[102,175,176],{},"基于 Gemini 2.0，能现场生成机器人控制代码，并支持本机本地运行",[84,178,179,184,187],{},[102,180,181],{},[24,182,183],{},"WVLA 2.0",[102,185,186],{},"宇树",[102,188,189],{},"量产数据反哺，已落地 G1 会议室自主整理等场景",[16,191,193],{"id":192},"vla-与传统分层控制的区别","VLA 与传统分层控制的区别",[78,195,196,209],{},[81,197,198],{},[84,199,200,203,206],{},[87,201,202],{},"维度",[87,204,205],{},"传统分层（感知→规划→控制）",[87,207,208],{},"VLA 端到端",[97,210,211,222,233,244,255],{},[84,212,213,216,219],{},[102,214,215],{},"改动成本",[102,217,218],{},"换任务要重调规则 \u002F 重训控制器",[102,220,221],{},"自然语言切换，模型泛化",[84,223,224,227,230],{},[102,225,226],{},"未知场景",[102,228,229],{},"容易失败（没写过的就崩）",[102,231,232],{},"靠语义理解兜底，鲁棒性更高",[84,234,235,238,241],{},[102,236,237],{},"可解释性",[102,239,240],{},"高（每一步可读）",[102,242,243],{},"低（黑盒动作）",[84,245,246,249,252],{},[102,247,248],{},"数据需求",[102,250,251],{},"低（规则主导）",[102,253,254],{},"高（要大量演示 \u002F 仿真数据）",[84,256,257,260,263],{},[102,258,259],{},"实时性",[102,261,262],{},"高",[102,264,265],{},"依赖算力，本机推理是趋势",[21,267,268,269,272],{},"所以当下工业落地多是",[24,270,271],{},"混合路线","：VLA 做高层语义决策，传统运控做底层稳定执行。",[16,274,275],{"id":275},"当前难点",[277,278,279,285,295,301],"ol",{},[61,280,281,284],{},[24,282,283],{},"数据稀缺","：真实机器人演示数据远少于互联网文本\u002F图像，仿真（如 NVIDIA GR00T-Dreams）能补约 40% 成功率，但长尾仍靠真实数据；",[61,286,287,290,291,294],{},[24,288,289],{},"本机算力","：云端推理有延迟、断网即瘫，所以 Gemini Robotics On-Device、Jetson Thor 这类",[24,292,293],{},"边端推理","成为 2026 重点；",[61,296,297,300],{},[24,298,299],{},"安全与越界","：端到端模型难加硬约束，工业场景需要\"动作范围 \u002F 力控上限\"的可验证护栏；",[61,302,303,306],{},[24,304,305],{},"长程任务漂移","：多步操作里一步错容易连锁翻车，需要世界模型做\"想象-验证\"回环。",[16,308,310],{"id":309},"vla-与世界模型机器人基础模型的关系","VLA 与世界模型、机器人基础模型的关系",[58,312,313,321,328],{},[61,314,315,320],{},[316,317,319],"a",{"href":318},"\u002Fwiki\u002Fvla.html","VLA"," 解决\"看到指令 → 怎么动\"；",[61,322,323,327],{},[316,324,326],{"href":325},"\u002Fwiki\u002Frobot-foundation-model.html","机器人基础模型"," 是更广义的\"在海量多本体数据上预训练、可零样本泛化\"的底座，VLA 常是它的一个实例化形态；",[61,329,330,333],{},[24,331,332],{},"世界模型","（如 NVIDIA Cosmos、Google Genie）补上\"在脑内模拟下一步会发生什么\"，让 agent 能先想后动。",[21,335,336],{},"三者叠起来，才接近\"通用具身智能\"。",[16,338,339],{"id":339},"延伸阅读",[58,341,342,349,354,366],{},[61,343,344,345],{},"上位概念：",[316,346,348],{"href":347},"\u002Fwiki\u002Fembodied-ai.html","具身智能",[61,350,351,352],{},"能力底座：",[316,353,326],{"href":325},[61,355,356,357,361,362],{},"代表实现：",[316,358,360],{"href":359},"\u002Fmodels\u002Fgemini-robotics.html","Google Gemini Robotics"," \u002F ",[316,363,365],{"href":364},"\u002Fmodels\u002Fisaac-gr00t.html","NVIDIA Isaac GR00T",[61,367,368,369,361,373],{},"同源数字智能：",[316,370,372],{"href":371},"\u002Fwiki\u002Fai-agent.html","AI Agent",[316,374,376],{"href":375},"\u002Fwiki\u002Ffunction-calling.html","Function Calling",{"title":56,"searchDepth":378,"depth":378,"links":379},3,[380,382,383,384,385,386,387],{"id":18,"depth":381,"text":19},2,{"id":41,"depth":381,"text":42},{"id":75,"depth":381,"text":76},{"id":192,"depth":381,"text":193},{"id":275,"depth":381,"text":275},{"id":309,"depth":381,"text":310},{"id":339,"depth":381,"text":339},"methodology",null,"md",{},true,"\u002Fwiki\u002Fvla","2026-07-23",[396,397],"gemini-robotics","isaac-gr00t",[],{"title":11,"description":56},"vla","wiki\u002Fvla","Vision-Language-Action 模型：把'看（视觉）''懂（语言）''做（动作）'端到端统一到一个模型里，是具身智能的核心技术路线，被誉为'机器人的 ChatGPT 时刻'。",[319,404,348,405,406,106],"Vision-Language-Action","机器人","扩散策略","DIDiTkdSEUZImzi-jokXecaD-iYTl01zoI36nwRStog",1784900539660]