[{"data":1,"prerenderedAt":382},["ShallowReactive",2],{"header-counts":3,"footer-counts":6,"wiki-robot-foundation-model":9},{"tools":4,"reviews":5},78,26,{"tools":4,"reviews":5,"playbooks":7,"news":8},22,24,{"id":10,"title":11,"body":12,"category":363,"cover":364,"description":352,"extension":365,"lastVerified":364,"meta":366,"navigation":367,"path":368,"published":369,"relatedModels":370,"relatedTools":373,"seo":374,"slug":375,"stem":376,"summary":377,"tags":378,"updated":369,"__hash__":381},"wiki\u002Fwiki\u002Frobot-foundation-model.md","机器人基础模型",{"type":13,"value":14,"toc":351},"minimark",[15,19,31,34,56,60,67,70,76,83,87,94,101,105,112,132,135,139,226,230,301,312,315],[16,17,18],"h2",{"id":18},"什么是机器人基础模型",[20,21,22,26,27,30],"p",{},[23,24,25],"strong",{},"机器人基础模型（Robot Foundation Model）"," 指的是：在跨本体、跨任务、跨场景的海量机器人数据上预训练出来的通用模型。它像 NLP 里的 GPT、视觉里的 ViT——",[23,28,29],{},"一次训练，处处可用","：换一台没见过的机器人、换一个没做过的任务，也能靠\"泛化\"直接上手，而不是每个场景重新写控制代码。",[20,32,33],{},"关键特征是三个\"跨\"：",[35,36,37,44,50],"ul",{},[38,39,40,43],"li",{},[23,41,42],{},"跨本体（Cross-embodiment）","：同一份模型权重，既能驱动双足人形，也能驱动机械臂、轮式底盘；",[38,45,46,49],{},[23,47,48],{},"跨任务（Cross-task）","：没见过的抓取 \u002F 装配 \u002F 整理，靠语言指令零样本触发；",[38,51,52,55],{},[23,53,54],{},"跨模态（Cross-modal）","：视觉、语言、动作、甚至力觉统一表示。",[16,57,59],{"id":58},"为什么需要它从专用-demo到通用部署","为什么需要它：从\"专用 demo\"到\"通用部署\"",[20,61,62,63,66],{},"2024 年之前的机器人，绝大多数是",[23,64,65],{},"专用设备","：焊汽车的只焊汽车，扫地的只扫地。每换一个任务就要重新设计控制逻辑、重新采集数据，根本无法规模化。",[20,68,69],{},"机器人基础模型想破的正是这个局：",[71,72,73],"blockquote",{},[20,74,75],{},"当\"教机器人做一件新事\"的成本，从\"养一个工程师团队半年\"降到\"说一句话\"，机器人产业才真正具备消费电子级的扩张速度。",[20,77,78,79,82],{},"这也是为什么 2026 上半年会出现\"万台下线\"\"73 天 IPO 过会\"这种以往不敢想的节奏——背后是",[23,80,81],{},"量产数据反哺模型、模型提升本体智能","的飞轮开始转起来。",[16,84,86],{"id":85},"机器人-scaling-law灵巧度也能大力出奇迹","机器人 Scaling Law：灵巧度也能\"大力出奇迹\"",[20,88,89,90,93],{},"2026 上半年最值得记的一笔，是 ",[23,91,92],{},"NVIDIA 在 GR00T N1.7\u002FN2 中首次提出\"机器人灵巧度 Scaling Law\"","——即机器人的操作成功率，会随训练数据量 \u002F 算力规模呈现可预测的爬升，和语言模型的 Scaling Law 同源。",[20,95,96,97,100],{},"这意味着机器人能力不再靠\"调参玄学\"，而可以像训练 LLM 一样",[23,98,99],{},"靠堆数据和算力系统性提升","。叠加 NVIDIA 的 GR00T-Dreams 仿真数据流水线（用仿真补真实数据，任务成功率约 +40%），行业第一次有了\"可复制的能力扩张公式\"。",[16,102,104],{"id":103},"世界模型让机器人先想后动","世界模型：让机器人\"先想后动\"",[20,106,107,108,111],{},"基础模型负责\"懂\"，但要在物理世界不翻车，还需要",[23,109,110],{},"世界模型（World Model）","——能在脑内模拟\"我这么做，下一帧世界会怎样\"。",[35,113,114,120,126],{},[38,115,116,119],{},[23,117,118],{},"NVIDIA Cosmos 3","：世界基础模型，帮机器人理解现实物理属性与空间关系；",[38,121,122,125],{},[23,123,124],{},"NVIDIA Newton 1.0","：与 DeepMind 合作开发的物理引擎，专攻接触、形变、抓取等刚柔耦合仿真；",[38,127,128,131],{},[23,129,130],{},"Google Genie \u002F V-JEPA 2（Meta 开源）","：自监督预测物理世界的通用世界模型。",[20,133,134],{},"世界模型让 agent 在真正执行前先\"想象-验证\"一遍，显著降低长程任务漂移。",[16,136,138],{"id":137},"代表模型20252026","代表模型（2025–2026）",[140,141,142,158],"table",{},[143,144,145],"thead",{},[146,147,148,152,155],"tr",{},[149,150,151],"th",{},"模型",[149,153,154],{},"机构",[149,156,157],{},"定位",[159,160,161,175,188,200,213],"tbody",{},[146,162,163,169,172],{},[164,165,166],"td",{},[23,167,168],{},"Isaac GR00T N1 \u002F N1.5 \u002F N2",[164,170,171],{},"NVIDIA",[164,173,174],{},"开放人形基础模型 + Cosmos + Newton 全栈，Unitree H2 Plus 为参考本体",[146,176,177,182,185],{},[164,178,179],{},[23,180,181],{},"Gemini Robotics",[164,183,184],{},"Google DeepMind",[164,186,187],{},"基于 Gemini 2.0，可现场生成控制代码，支持本机本地推理",[146,189,190,195,197],{},[164,191,192],{},[23,193,194],{},"RT 系列（RT-1\u002FRT-2）",[164,196,184],{},[164,198,199],{},"早期把网络知识迁移到动作的奠基性探索",[146,201,202,207,210],{},[164,203,204],{},[23,205,206],{},"Helix",[164,208,209],{},"Figure AI",[164,211,212],{},"双系统架构，验证未知环境双机协作",[146,214,215,220,223],{},[164,216,217],{},[23,218,219],{},"WVLA 2.0",[164,221,222],{},"宇树",[164,224,225],{},"量产数据反哺的本土具身大模型",[16,227,229],{"id":228},"与-llm-基础模型的异同","与 LLM 基础模型的异同",[140,231,232,244],{},[143,233,234],{},[146,235,236,239,242],{},[149,237,238],{},"维度",[149,240,241],{},"LLM 基础模型",[149,243,11],{},[159,245,246,257,268,279,290],{},[146,247,248,251,254],{},[164,249,250],{},"输入",[164,252,253],{},"文本",[164,255,256],{},"图像 \u002F 语言 \u002F 传感器",[146,258,259,262,265],{},[164,260,261],{},"输出",[164,263,264],{},"token",[164,266,267],{},"关节动作 \u002F 轨迹",[146,269,270,273,276],{},[164,271,272],{},"训练数据",[164,274,275],{},"互联网文本（海量易得）",[164,277,278],{},"机器人演示（稀缺、贵）",[146,280,281,284,287],{},[164,282,283],{},"Scaling Law",[164,285,286],{},"已验证",[164,288,289],{},"2026 才被明确提出",[146,291,292,295,298],{},[164,293,294],{},"落地风险",[164,296,297],{},"幻觉",[164,299,300],{},"物理伤害（更高危）",[20,302,303,304,307,308,311],{},"正因为训练数据稀缺且危险，机器人基础模型格外依赖",[23,305,306],{},"仿真 + 真实数据混合","和",[23,309,310],{},"可验证的安全护栏","。",[16,313,314],{"id":314},"延伸阅读",[35,316,317,325,332,344],{},[38,318,319,320],{},"落地形态：",[321,322,324],"a",{"href":323},"\u002Fwiki\u002Fvla.html","VLA 模型（视觉-语言-动作）",[38,326,327,328],{},"上位概念：",[321,329,331],{"href":330},"\u002Fwiki\u002Fembodied-ai.html","具身智能",[38,333,334,335,339,340],{},"代表实现：",[321,336,338],{"href":337},"\u002Fmodels\u002Fisaac-gr00t.html","NVIDIA Isaac GR00T"," \u002F ",[321,341,343],{"href":342},"\u002Fmodels\u002Fgemini-robotics.html","Google Gemini Robotics",[38,345,346,347],{},"行业信号：",[321,348,350],{"href":349},"\u002Fnews\u002F2026\u002Fembodied-ai-h1-2026.html","2026 上半年具身智能十大进展",{"title":352,"searchDepth":353,"depth":353,"links":354},"",3,[355,357,358,359,360,361,362],{"id":18,"depth":356,"text":18},2,{"id":58,"depth":356,"text":59},{"id":85,"depth":356,"text":86},{"id":103,"depth":356,"text":104},{"id":137,"depth":356,"text":138},{"id":228,"depth":356,"text":229},{"id":314,"depth":356,"text":314},"concept",null,"md",{},true,"\u002Fwiki\u002Frobot-foundation-model","2026-07-23",[371,372],"isaac-gr00t","gemini-robotics",[],{"title":11,"description":352},"robot-foundation-model","wiki\u002Frobot-foundation-model","在海量多本体机器人数据上预训练、可零样本泛化到新任务\u002F新硬件的通用模型，是具身智能从'专用 demo'走向'通用部署'的关键。",[11,379,331,283,380],"Foundation Model","世界模型","8Lv7b6QWzsEqE4oT9FL3ZD6zTPM_LMaY7L7KOdDFWSk",1784900539425]