SDE Universes·新思想前沿AI与知识生产
新思想前沿 · AI与知识生产

具身智能

近二十年 · 两幕 · 20 个新思想 · 约 23,730 字 · 王德生 亲撰 · 2026 年 8 月

具身智能并不是给机器人装上一个更大的语言模型,而是研究智能怎样在身体、传感器、动作、材料、空间、时间与他者之间闭环发生。过去二十年,这个领域先把“身体不是外设”写进软硬件:顺应结构可以承担部分计算,低价深度相机与高分辨触觉让环境通过行动被测量,仿真器与灾难竞赛则把接触、失衡和通信中断变成可复查的工程对象。2016年以后,规模路线接管:随机化缩短仿真—现实距离,具身基准把导航与家务拉成长程任务,GPU并行仿真、语言可供性、机器人Transformer、视觉—语言—动作模型和跨形态数据池开始争夺“通用身体策略”的定义。二十条按闭环接口而非产品热度排列;每条都把能力读数与身体条件、反号失效和可追责量纲放在同一账上。

【第一幕】上一个十年 · 约 2006–2016

第一幕完成的是“身体进入计算”。研究对象从一个先有完整世界模型、再向执行器下命令的程序,转为必须依靠形态、接触和主动感知才能形成状态的系统。开放人形平台、实时三维重建、视觉触觉、接触动力学仿真、灾难现场竞赛与端到端视觉运动学习,让具身智能第一次拥有可复制装置、共享读数和公开失败。

甲、形态计算:身体第一次被当成控制器的一部分Morphological Computation: The Body Becomes Part of the Controller

提出Pfeifer与Bongard,2006年《How the Body Shapes the Way We Think》;Hauser、Ijspeert、Füchslin、Pfeifer与Maass,2011年《Biological Cybernetics》105:355–370,DOI 10.1007/s00422-012-0471-0。 争议Hansen, N., Su, H., & Wang, X. (2023). TD-MPC2: Scalable, Robust World Models for Continuous Control. arXiv:2310.16828.。 最新(2024年文献)Hauser, H., & Hughes, J. (2024). Morphological Computation—Past, Present and Future. Device.。 关键身体材料若能把外力过滤、储能和回弹,控制器所需计算量会随形态而变,而非只随算法而变。

机器人架构把身体视为算法末端:感知模块重建世界,规划器求轨迹,控制器再命令刚性关节。Pfeifer与Bongard在2006年提出图景:身体的几何、质量、顺应性和传感布局会筛选可发生的运动。壁虎脚、昆虫腿或柔性鳍不等待中央计算器逐点求解,材料在接触时已完成部分稳定、滤波与能量回收。智能由此被身体共同构成。

本条锁定的命题是:决定闭环控制复杂度的只有身体是否把环境约束转成可利用的动力学。被动顺应的腿落地时吸收冲击,把高速反馈移进材料;关节耦合把庞大动作空间压成少数稳定模式。形态计算要求把身体加入资源账:同一任务在两种形态上需要多少状态、控制频率与校正能量(Pfeifer 2006)。对形态计算:身体第一次被当成控制器的一部分Morphological Computation: The Body Becomes Part of the Controller而言,真正需要登记的不是又一个平均分,而是由“决定闭环控制复杂度的只有身体能否把环境约束转成可利用的动力学”推出的每一步中介、责任人和可撤回条件;〔对象清单〕缺少任何一环,都不能把相关性写成机制。

Hauser等用柔顺质量—弹簧网络证明,身体瞬态可以像储备池计算那样映射输入历史,并以线性读出完成非线性任务;2011年论文在Biological Cybernetics第105卷给出可训练读出与记忆能力的模拟。可核验读数因此不是“看起来像生物”,而是给定预测误差下外部控制器的维数、传感带宽和每步优化次数下降多少。2012年的反馈研究又显示,加入少量回路可扩大可用动力学范围,身体和控制并非二选一(Hauser 2011)。

争议集中在“什么才算计算”。若把任何物理变化都叫计算,弹簧、桌面和空气也会被无限纳入,概念失去区分力;若只承认数字符号运算,又会漏掉身体确实改变控制负担的事实。形态还把能力与环境绑死:为平地跑步优化的柔顺腿,在碎石或搬运时可能放大摆动;身体越替控制器做决定,改变任务后反而越难重编程。Müller与Hoffmann 2017要求用可替代性、信息变换与任务贡献来约束术语。

工程上应做“身体消融”而非只展示动作:保持控制目标不变,依次改变刚度、几何、传感位置和反馈频率,测外部计算、能耗与失败边界。软体或人形平台还要记录材料老化、温度和负载,因为训练时的形态会随使用漂移。若策略只在一副身体上成功,不能把收益全归给算法;若更换形态后用大量再训练追回表现,也不能宣称原形态提供了可迁移智能(Hauser 2012)。

它与第051号第七条“建模路线的成就与它的边界”形成反向接口:该条问模型何时足够精确,本条问哪些动力学不必显式重建。二者应把模型误差、身体被动稳定和反馈带宽放进同一预算。2026年的前沿仍未证明复杂身体可长期承担通用计算;决定性证据是跨任务、跨材料老化仍减少外部控制样本与能耗。

位置S——把形态与材料动力学本身当成智能系统的决定性资源 单因决定闭环控制复杂度的只有身体能否把环境约束转成可利用的动力学 预设〔01 谁进入分母〕控制成本的分母必须把身体完成的滤波、储能与稳定也计入 量纲达到同一任务成功率所需外部控制维数/刚性基准所需控制维数 失效当任务离开形态调谐范围时,身体承担的控制越多,重新编程后的跨任务性能反而越低 自曝对象清单独立核验:柔顺质量—弹簧网络只证明特定瞬态可被读出,尚未说明材料能替代复杂语义规划;独立撤回检查落在对象清单 空栏材料老化、制造离散、温度依赖和身体变化后的再校准成本没有进入一次性演示 异名机器人学称“建模路线的边界”;见第051号第七条“建模路线的成就与它的边界”

乙、iCub:认知发展被装进一副可共享的身体iCub: Cognitive Development Gets a Shared Body

提出Metta、Natale、Nori等,2010年《Neural Networks》23:1125–1134,DOI 10.1016/j.neunet.2010.08.010。 争议Hauser, H., Ijspeert, A. J., Füchslin, R. M., Pfeifer, R., & Maass, W. (2012). Towards a theoretical foundation for morphological computation. Biological Cybernetics, 105, 355–370. DOI: 10.1007/s00422-012-0471-0.。 最新(2024年文献)Hauser, H., & Hughes, J. (2024). Morphological Computation—Past, Present and Future. Device.。 关键发展性认知若要可比较,研究者必须共享身体自由度、传感视角与社会互动接口,而不只共享代码。

发展机器人学主张认知从持续的感觉—运动经验长出,但早期实验室各用不同机械臂、摄像头和关节限制,“学习到抓取”可能只是硬件差异。欧盟RobotCub项目把这个方法论问题做成iCub:一副约幼儿大小、双眼双手、可坐可爬的开放人形平台,供多个团队研究视觉、动作、模仿与社会互动。身体不再是论文附录中的设备清单,而成为让认知发展实验可复现的共同条件(Metta 2010)。

〔事件时间轴〕本条的单因命题是:决定发展性具身研究能否累积的只有身体与感觉运动接口是否跨实验室保持可比,而不是认知模型名称相同。相同代码装到不同视场、手指数和关节阻尼上,会接触到不同世界;相反,共享形态让注视、伸手、抓握与他人示范形成共同事件词表。iCub因此把“身体经验”从无法转移的实验背景,改成能够版本化、重放和公开讨论的研究基础设施。

2010年平台论文报告iCub约104厘米高、约22千克、全身53个自由度,头部双目相机、关节位置与力矩、皮肤和手部接口支持闭环探索;论文发表于Neural Networks第23卷8–9期1125–1134页。关键读数不是53越大越好,而是不同实验可以明确说明用了哪些自由度、传感通道与控制周期。开放机械图、软件和中间件使同一注意或模仿算法能在多台身体上对照,而不必每次重新发明机器人。

标准身体也会标准化盲点。iCub的幼儿外形不等于它拥有儿童的肌肉、触觉密度、成长史或照护关系;把一组预设关节和相机称为“发展”,可能把工程课程误写成认知发生。平台维护昂贵,硬件批次、线缆摩擦和皮肤损坏会破坏名义上的同一性。若领域越依赖一副标准人形,研究问题反而越可能收缩到该平台容易展示的注视、递物和桌面操作。

复现实验应同时报告硬件序列号、校准、失效传感器、控制频率、人工复位和训练接触小时;只发布网络权重不足以复现身体史。发展性主张还要用反事实形态检验:遮住一只眼、改变臂长、减少手指或置换视角,看表征是否随感觉运动统计重新组织。2026年的好奇心与情感架构若只在单台iCub一次互动中成立,仍不能区分身体诱导、操作者提示和社会脚本。

它与第051号第一条“动态平衡被做成工程”关注同一副人形的两种读数:该条衡量稳定与运动,本条衡量共享身体能否支撑认知累积。还可接到第036号认知神经科学关于实验任务与自然认知的落差:机器人身体提供可操控因果条件,却非人的替身。真正进展应表现为跨iCub实例、实验室和形态保留的规律。

位置D——把共享身体、接口与校准史当成发展性认知可以累积的路径 单因决定具身发展研究能否累积的只有感觉运动接口能否跨实验室保持可比 预设〔02 单一读数代表复杂对象〕同一平台上的一次任务成功足以代表发展、身体与社会互动的复杂过程 量纲跨实验室保持同方向效应的任务数/全部在单台iCub上报告成功的任务数 失效当标准平台的形态偏差主导课题选择时,共享度越高,研究问题的身体多样性反而越低 自曝事件时间轴独立核验:iCub的53个自由度和开放接口没有复制儿童的成长、照护与代谢身体;独立撤回检查落在事件时间轴 空栏硬件批次差异、人工复位、磨损与操作者社会线索常未写入训练记录 异名机器人学称“动态平衡被做成工程”;见第051号第一条“动态平衡被做成工程”

丙、KinectFusion:看见三维改成边走边建KinectFusion: 3D Perception Becomes Active Reconstruction

提出Newcombe、Izadi、Hilliges等,2011年ISMAR论文《KinectFusion》,DOI 10.1109/ISMAR.2011.6092378。 争议Hauser, H., Ijspeert, A. J., Füchslin, R. M., Pfeifer, R., & Maass, W. (2012). Towards a theoretical foundation for morphological computation. Biological Cybernetics, 105, 355–370. DOI: 10.1007/s00422-012-0471-0.。 最新(2024年文献)Keetha, N., Karhade, J., Jatavallabhula, K. M., et al. (2024). SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM. CVPR.。 关键三维状态不必在行动前一次识别完成,身体移动本身可以持续改善地图与位姿估计。

二维相机可以辨认物体,却很难直接告诉机械臂桌沿多远、通道能否通过、把手朝哪一面。激光扫描器和多目系统曾能提供几何,但价格、标定和计算限制让密集三维主要停在专用实验室。Kinect带来的消费级深度流与KinectFusion的实时融合改变了门槛:操作者或机器人移动相机时,每帧深度被配准到同一体素地图,位姿估计和表面重建相互校正。

本条主张:决定具身系统能否形成可行动空间的只有感知是否随身体运动持续更新三维状态,而不是单帧识别标签有多准。移动不是对感知的干扰,而是制造视差、补足遮挡和检验几何的实验动作。机器人因此可以围绕物体换视角,用新深度修正旧地图,再让地图约束下一步;“先看清再行动”的线性管线被改成行动—测量—更新的循环(KinectFusion 2011)。

Newcombe等在2011年展示标准Kinect深度相机上的实时稠密表面映射与六自由度跟踪,输出可交互的室内三维模型;论文载ISMAR第127–136页。系统用截断有符号距离函数融合深度,并以迭代最近点估计相机位姿。可核验读数是每秒帧数、轨迹漂移、表面误差与可覆盖体积,而不是截图是否逼真。它让三维地图第一次以视频速度进入桌面级计算。

原始KinectFusion假定场景近似静态、连续帧有足够重叠且工作体积有限;反光、透明、阳光、快速运动和人体进入都会破坏深度或配准。地图越稠密,错误位姿被融合后的“鬼影”反而越牢固。Kintinuous用移动体积扩大范围,却没有取消回环、动态物体和传感盲区。看见一个完整网格也不等于知道物体可抓、可开或属于谁。〔装置边界〕面向下一轮材料,具身智能应优先补齐“透明材质、阳光干扰、地图过期与从未观测空间没有出现在漂亮网格里”的原始记录,并把“当动态物体与位姿漂移被融合进地图时,累积帧数越多,错误表面反而越稳定”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

具身系统应把几何状态连同不确定性、时间戳和观测视角保存:旧表面在多久后过期,哪些体素来自单次斜视,哪些区域从未被看见。规划器不应把未知空间默认为空;遇到高不确定区,应优先选择能降低碰撞风险的新视点。神经辐射场和3D Gaussian Splatting虽改善外观与连续表示,仍要另报重建延迟、动态更新与度量尺度误差,不能用渲染质量代替可行动几何。

它与第050号计算机视觉第五条“三维这条线在同期成熟”是同一突破的具身异名:视觉侧衡量重建和识别,本条衡量身体能否以移动主动改变证据。也与第051号第三条“感知与建图先被解决”相接,但“先被解决”只在静态、可回环和传感可见条件下成立。2026年的决定性测试应把动态人群、透明物体与长时变化纳入同一轨迹,报告错误地图诱发的动作风险。

位置E——把环境在行动中持续回写三维状态当成具身认知成立的条件 单因决定系统能否形成可行动空间的只有身体运动是否持续产生并更新三维证据 预设〔03 有限近似控制无限对象〕有限视场与有限体素能够近似开放且持续变化的真实空间 量纲在不碰撞条件下被验证可行动的体素数/地图声称已重建的全部体素数 失效当动态物体与位姿漂移被融合进地图时,累积帧数越多,错误表面反而越稳定 自曝装置边界独立核验:KinectFusion的实时稠密结果建立在静态场景、连续重叠和有限工作体积上;独立撤回检查落在装置边界 空栏透明材质、阳光干扰、地图过期与从未观测空间没有出现在漂亮网格里 异名计算机视觉称“三维这条线在同期成熟”;见第050号第五条“三维这条线在同期成熟”

丁、GelSight:接触被改写成一幅可学习的图像GelSight: Contact Becomes a Learnable Image

提出Johnson与Adelson,2009年CVPR Workshop论文《Retrographic Sensing for the Measurement of Surface Texture and Shape》。 争议Yuan, W., Dong, S., & Adelson, E. H. (2017). GelSight. Sensors, 17, 2762. DOI: 10.3390/s17122762.。 最新(2025年文献)Luu, Q. K., Nguyen, D. Q., Nguyen, N. H., Dam, N. P., & Ho, V. A. (2025). Vision-Based Proximity and Tactile Sensing for Robot Arms. IEEE Transactions on Robotics, 41, 5000–5019. DOI: 10.1109/TRO.2025.3593087.。 关键手指只有把接触几何、剪切与滑移转成高分辨可记录信号,灵巧操作才有闭环证据。

摄像头在接触前很强,一旦手指遮住物体,最关键的摩擦、微滑与局部变形反而不可见。传统力传感器给出总力,阵列触觉的空间分辨率和布线又受限制。GelSight在柔软透明弹性体后放置相机与照明:物体压出表面形状,反射图像记录微细纹理和剪切。接触由少数电压值变成高分辨图像,计算机视觉工具第一次可以直接进入指尖。

〔样本分层〕本条的单因命题是:决定精细操作能否闭环的只有接触状态能否以足够空间分辨率被观测,而不是外部相机像素多少。插接、拧盖、理线和拿软物体的失败常发生在遮挡后的毫米以内;若手指不知道接触位置与滑移,规划再聪明也只能开环猜测。视觉触觉把“抓到了吗、正在滑吗、压坏了吗”改成连续可学习的状态(GelSight 2017)。

Yuan、Dong与Adelson在2017年Sensors第17卷2762号系统展示几何、法向力、剪切和滑移估计;早期原理可追到Johnson与Adelson 2009。其读数包括微尺度表面重建、接触力误差与物体识别率,而非“有触觉”这一布尔标签。传感器还能看见材料纹理和边缘,使抓取控制在视觉被遮住后继续获得反馈;GelSight Wedge 2021又扩展接触区域与安装形式。

图像并不天然等于力。弹性体硬度、涂层磨损、照明漂移、温度与曲面几何都会改变同一接触产生的像素;训练集若主要来自刚性干净物体,遇到油污、织物或尖锐边缘便会失配。分辨率越高,模型越可能记住某片传感皮肤的制造纹理,换一枚指尖后反而下降。相机帧率和处理延迟也可能错过快速初滑(GelSight 2017)。

工程验收要跨传感器实例、磨损阶段和材料类别校准,并把原始图像、力标定、接触位置与动作时间对齐。控制策略应报告触觉消融:去掉传感、降低分辨率、增加延迟后,任务成功和最大接触力怎样变化。2025年的Sim2Real触觉分类若只在渲染外观上接近,而没有复制弹性体滞后和摩擦历史,就不应被当作真实接触迁移(GelSight Fin Ray 2022)。〔样本分层〕证据链还要把Johnson与Adelson,2009年CVPR Workshop论文《Retrographi的起点材料与更新文献放在同一比较表里,并逐项报告“手指只有把接触几何、剪切与滑移转成高分辨可记录信号,灵巧操作才有闭环证据”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

它与第051号机器人学第三条“感知与建图先被解决”构成近场反例:远距视觉地图可以成熟,接触后的状态仍可能完全不可见;也可与第050号计算机视觉第十二条“数据、偏斜与真实性”对撞,因为同一视觉网络在指尖上面对的是材料老化而非网页分布。决定性进展不是触觉图更漂亮,而是在未知物体、未知皮肤实例与连续使用后仍减少滑落和损伤(Sensors 2017)。

位置S——把高分辨接触观测当成灵巧操作的决定性状态 单因决定精细操作能否闭环的只有接触几何与滑移是否被足够分辨率观测 预设〔04 测量不改变被测对象〕柔软传感皮肤的形变不会显著改变原本要测的接触与摩擦 量纲在未知物体上被触觉及时阻止的滑移次数/全部已发生初滑次数 失效当弹性体磨损纹理成为模型捷径时,像素分辨率越高,换传感器后的识别率反而越低 自曝样本分层独立核验:GelSight把接触变成图像,却仍需外部标定才能把像素可靠换成三维力;独立撤回检查落在样本分层 空栏油污、温度、皮肤滞后、尖锐损伤与长期照明漂移常被短期数据集排除 异名机器人学称“感知与建图”;见第051号第三条“感知与建图先被解决”

戊、MuJoCo:接触动力学成为可重复的实验世界MuJoCo: Contact Dynamics Becomes a Repeatable Experimental World

提出Todorov、Erez与Tassa,2012年IROS论文《MuJoCo》,DOI 10.1109/IROS.2012.6386109。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2026年文献)Physical Intelligence. (2026). π0.7: General-Purpose, Steerable, and Compositional Robot Policies. Official research report, 16 April 2026.。 关键具身策略只有在摩擦、碰撞、关节与执行器都可版本化时,失败才可能被重放而不是归咎于“现实太复杂”。

机器人学习需要成千上万次试错,但真实机械臂的每次碰撞都花时间、磨损设备并可能伤人。早期图形物理引擎能做动画,却未必适合优化控制:接触弹簧会震荡,关节约束的数值误差会把策略训练成利用模拟漏洞。MuJoCo从“Multi-Joint dynamics with Contact”出发,把广义坐标、约束和速度步进算法围绕模型预测控制设计,使连续控制、足式运动和操作拥有可脚本化的动力学实验台。

本条锁定的命题是:决定具身学习能否形成可重放证据的只有接触动力学与执行器模型是否可版本化,而不是模拟画面多逼真。研究者必须能保存同一模型、初态、控制序列和求解器参数,复现哪一次脚尖打滑或手指穿透;否则百万步训练只留下一个权重文件。MuJoCo的XML模型与确定性步进把身体、关节、碰撞体、摩擦和驱动写成实验配置。

Todorov等2012年在IROS第5026–5033页介绍递归多体动力学和高效接触求解,DOI为10.1109/IROS.2012.6386109。公开材料报告特定模型上可达远快于实时的求解速度,使优化器在执行一个真实动作前评估大量候选轨迹。后来DeepMind Control Suite、Gym环境和2022年开源扩大了复用。可核验读数应包括每秒仿真步、接触误差、能量漂移与同轨迹重放差异(MuJoCo 2012)。

可重复不等于真实。摩擦锥、软材料、电缆、液体、齿隙和传感噪声都被参数近似;策略会找到求解器漏洞,例如抖动或不现实冲量。仿真越快,若偏差固定,数据反而越快堆向同一错误世界。不同引擎对接触任务给出不同稳定性,说明“物理正确”不能由单一模拟器自证(MuJoCo 2012)。

工程上应把引擎版本、时间步、求解迭代、摩擦、接触软化与随机种子随策略发布,并做跨引擎与实物小样验证。对关键任务可用系统辨识从实物轨迹反推参数,再保留参数后验而非一个最佳值。MJX和MuJoCo Playground把并行推向GPU后,验收还要分开报告吞吐与模型保真;更快的错误物理不能算更好的具身基础设施(Collins 2021)。

它与第051号第四条“开源生态与仿真器”共享工具史,但本条把仿真器定位为证据制度:什么状态可保存、接触可重放、偏差能被测。与第046号第四条“模拟器与基准”对接时,还要区分策略比较与物理可信度;排行榜可在错误动力学上稳定。2026年前沿应报告仿真—现实残差随任务和形态的分布。〔版本登记〕本条的边界案例应从“电缆、液体、齿隙、材料老化和传感漂移通常被压成少数静态参数”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当模型偏差固定且可被策略利用时,仿真吞吐越高,错误物理上的过拟合反而越快”究竟是偶发噪声,还是足以改变结论方向的系统反例。

位置D——把版本化动力学、初态与求解器组成的仿真实验链当成可重复路径 单因决定具身学习能否重放的只有接触动力学与执行器模型是否可版本化 预设〔05 缺失即不存在〕模拟器没有表达的摩擦历史、柔性与磨损可以在评价中忽略 量纲跨引擎并经实物复核仍保持成功的策略数/在单一MuJoCo版本成功的策略数 失效当模型偏差固定且可被策略利用时,仿真吞吐越高,错误物理上的过拟合反而越快 自曝版本登记独立核验:MuJoCo的可重放轨迹只忠实于给定模型,并不自动忠实于未建模的真实接触;独立撤回检查落在版本登记 空栏电缆、液体、齿隙、材料老化和传感漂移通常被压成少数静态参数 异名机器人学称“开源生态与仿真器”;见第051号第四条“开源生态与仿真器”

己、DARPA机器人挑战:完整任务暴露遥操作的天花板The DARPA Robotics Challenge: Whole Tasks Expose the Ceiling of Teleoperation

提出DARPA,2012–2015年Robotics Challenge;Krotkov、Hackett、Jackel等,2017年《Journal of Field Robotics》34:229–240,DOI 10.1002/rob.21683。 争议Hauser, H., Ijspeert, A. J., Füchslin, R. M., Pfeifer, R., & Maass, W. (2012). Towards a theoretical foundation for morphological computation. Biological Cybernetics, 105, 355–370. DOI: 10.1007/s00422-012-0471-0.。 最新(2026年文献)Physical Intelligence. (2026). π0.7: General-Purpose, Steerable, and Compositional Robot Policies. Official research report, 16 April 2026.。 关键具身智能必须在移动、操作、通信退化与跌倒恢复同一赛程中成立,单项实验不能代替整机自治。

实验室里,机器人可在平地走路、单独开门或由高速网络精细遥控;福岛事故式灾难却同时带来楼梯、瓦砾、阀门、工具和通信中断。DARPA机器人挑战把这些条件合成一条公开赛程,并故意削弱通信,让人类不能逐关节操纵。竞赛问题不再是某个算法是否优雅,而是整副身体能否在限时、未知和可见失败中把多项能力接起来。〔失败谱〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定灾难机器人是否具身自治的只有整机能否在通信受限下连续完成异质任务”的操作定义,仍能复算“无需人工重置完成的任务环节数/赛程全部八个物理环节”,否则所谓转向可能只是数据管线或命名变化。

〔失败谱〕本条的单因命题是:决定灾难机器人是否具有具身自治的只有整机在通信受限条件下能否连续完成异质物理任务,而不是单项技能峰值。行走、驾驶、开门、操作阀门、使用工具、跨越瓦砾和上楼梯必须共享状态与恢复机制;任何一环需要现场工程师重置,任务链就断。竞赛因此把“自主”从漂亮动作改成任务期间人类介入、通信流量和恢复时间(DRC 2015)。

2015年决赛有23支队伍正式参赛,赛程含8项任务;三队取得8分满分,KAIST的DRC-Hubo以44分28秒获胜。官方分析记录两天正式运行中发生26次跌倒,只有一支队伍能在跌倒后自行起身继续。通信退化迫使队伍采用监督自治,却仍普遍依赖人类选择目标和恢复。数字显示全身任务已可完成,也显示速度、鲁棒和自主距离救援部署仍远(Krotkov 2017)。

竞赛会塑造研究。固定八项任务和计分规则鼓励围绕已知门把、楼梯与工具调试;昂贵硬件和团队规模又把很多实验室排除。若机器人越适配赛场,离开标准物体后反而可能更脆弱。满分也不等于可用:44分钟完成八项对灾难响应仍很慢,跌倒可能毁坏设备,远程人员的认知劳动并未在单一分数里显现(Murphy 2015)。

后续具身评测应继承完整任务与公开失败,同时随机化物体、路线、通信和恢复条件,并把人工点击、口头提示、复位和隐性地图全部计入。一个最低验收是把操作员带宽逐级降低,画出成功率—介入量曲线,而不是只贴“自主”标签。人形模型还需报告跌倒能量、近失事故和自起身次数,避免把危险失败剪出演示视频(DRC 2015)。

它与第051号第二条“两次竞赛把边界标出来”使用同一事件,但机器人学侧记录竞赛推动硬件,本条把DRC视为具身自治的公开清算:整机耦合与人工依赖被迫同场出现。与第205号风险与灾害治理的演练逻辑相连时,可见竞赛成功仍不等于组织部署;机器人需进入指挥、责任与现场安全链。DRC留下的核心资产是失败可见性,而不只是冠军。

位置E——把受限通信、完整赛程与公开失败当成自治定义的环境条件 单因决定灾难机器人是否具身自治的只有整机能否在通信受限下连续完成异质任务 预设〔06 通过形式审查=实质合规〕赛程得分足以代表真实灾难现场的可部署性 量纲无需人工重置完成的任务环节数/赛程全部八个物理环节 失效当物体和路线被长期公开调试时,赛场得分越高,换场景后的相对性能反而可能越低 自曝失败谱独立核验:DRC的23队与八项赛程仍是人为封闭世界,通信受限也没有取消高技能后台团队;独立撤回检查落在失败谱 空栏部署许可、伤害责任、长期维护和现场救援人员对机器人失败的处置未进入排名 异名机器人学称“两次竞赛把边界标出来”;见第051号第二条“两次竞赛把边界标出来”

庚、端到端视觉运动策略:像素与力矩用同一个损失对齐End-to-End Visuomotor Policies: Pixels and Torques Share One Loss

提出Levine、Finn、Darrell与Abbeel,2016年《JMLR》17(39):1–40/17:1334–1373。 争议Hauser, H., Ijspeert, A. J., Füchslin, R. M., Pfeifer, R., & Maass, W. (2012). Towards a theoretical foundation for morphological computation. Biological Cybernetics, 105, 355–370. DOI: 10.1007/s00422-012-0471-0.。 最新(2026年文献)Physical Intelligence. (2026). Multi-Scale Embodied Memory for Long-Horizon Robot Control. Official research report.。 关键感知表征若与任务控制共同优化,系统会保留影响动作的视觉因素,而不是先追求通用识别准确率。

传统机器人把视觉、状态估计与控制分别优化:视觉先识别瓶盖,几何模块估位姿,控制器再算力矩。每层都可能在自己的指标上正确,却把下一层真正需要的微小接触线索丢掉。Levine等提出用引导策略搜索训练卷积策略,从相机图像和关节状态直接输出电机力矩;局部轨迹控制器提供监督,使真实机器人有限试验也能训练高容量网络。

本条锁定的命题是:决定视觉能否服务物理动作的只有感知与控制是否由同一任务损失联合塑形,而不是物体识别率多高。拧瓶盖需要看见边缘、手与盖的相对位置,却不需要给物体写完整语义标签;联合优化让网络保留对控制误差敏感的视觉特征。像素—力矩不是取消所有中间结构,而是把最终动作后果送回表征学习(Levine 2016)。〔机构接口〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当背景捷径比接触几何更易降低损失时,端到端拟合越充分,跨场景成功率反而越低”做至少两轮外部复算,若方向翻转,端到端视觉运动策略:像素与力矩用同一个损失对齐End-to-End Visuomotor Policies: Pixels and Torques Share One Loss的结论必须随之收窄。

JMLR论文的卷积策略约含92,000个参数,在真实PR2上完成把衣架挂起、把玩具锤放到钉子旁和把瓶盖拧紧等任务;输入为图像与关节配置,输出为关节力矩。引导策略搜索把策略优化转成有轨迹控制器监督的学习,避免完全从随机动作摸索。可核验读数包括不同初始位置的任务成功、轨迹成本和视觉扰动敏感性,而不只是训练损失。

端到端会压缩诊断接口。相机偏色、背景更换或手臂外观改变时,失败究竟来自视觉、状态还是控制不易分开;局部轨迹教师还使用训练时的全状态与动力学,学生可能继承不可部署的捷径。训练场景越固定,联合损失越会奖励背景相关性,离开实验桌后反而比模块化几何更差。高频力矩输出也不能绕过硬件安全边界(JMLR 2016)。

工程实现应保留探针和替代路径:对视觉特征做遮挡与背景反事实,给关键几何量设置辅助读出,用传统控制器作安全盾,并记录每次干预。比较必须固定数据量与机器人小时,因为“端到端更好”可能来自更多专用试验。2024年线性反馈研究说明,复杂视觉编码之后仍可保留可分析控制结构;是否端到端应按样本外扰动和可诊断性判断。

它与第051号第五条“从示教到学习的第一批尝试”是同一证据的具身切法:机器人学侧记录学习进入操作,本条强调任务损失怎样重写感知。与第050号第四条“卷积网络接管”对撞时,分类侧的平移不变性未必是接触控制需要的精确等变性。真正的接口不是模块数多少,而是哪些中间状态必须显式供安全、迁移和人类审计使用(JMLR 2016)。

位置S——把任务损失联合塑形的感觉运动策略当成动作智能的决定性单元 单因决定视觉能否服务动作的只有感知表征是否与控制后果由同一损失共同优化 预设〔07 局部最优可加总为整体最优〕训练桌上轨迹成本的下降能够代表部署环境的整体动作质量 量纲更换背景与初始位姿后仍成功的任务数/训练场景内成功的全部任务数 失效当背景捷径比接触几何更易降低损失时,端到端拟合越充分,跨场景成功率反而越低 自曝机构接口独立核验:引导策略搜索依赖训练期全状态教师,不能证明像素策略独自发现了全部控制结构;独立撤回检查落在机构接口 空栏相机漂移、控制饱和、安全盾介入与失败归因未被单一任务成本完整记录 异名机器人学称“从示教到学习”;见第051号第五条“从示教到学习的第一批尝试”

辛、Dex-Net:抓取经验先在合成数据里规模化Dex-Net: Grasp Experience Scales First in Synthetic Data

提出Mahler、Pokorny、Hou等,2016年ICRA论文《Dex-Net 1.0》,DOI 10.1109/ICRA.2016.7487342。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2026年文献)Physical Intelligence. (2026). π0.7: General-Purpose, Steerable, and Compositional Robot Policies. Official research report, 16 April 2026.。 关键机器人数据规模可以由解析力学、三维模型和不确定性采样先行生成,但合成标签的物理假设必须随数据一起交付。

抓取学习曾受真实试验速度限制:每个物体要摆放、抓取、判断成败再复位,数万次就需要数百机器人小时。Dex-Net把抓取拆成可计算对象:收集三维网格,采样平行夹爪姿态,用力闭合和不确定性模型给抓取标注,再在云端复用。经验不再只来自实物动作,而可先从几何与接触假设生成大规模候选。

〔资源预算〕本条的单因命题是:决定抓取策略能否规模化的只有物理先验能否把未执行抓取转成可信训练标签,而不是实物机器人数量。解析指标把物体形状、摩擦、姿态误差与夹爪几何换成成功概率,允许模型在碰实物前看见数百万反事实抓取。数据规模由机器人小时转向计算与模型库,具身学习第一次出现接近视觉数据集的扩展路径(Dex-Net 2016)。

Dex-Net 1.0汇集超过10,000个三维物体模型和约250万平行夹爪抓取;论文正文给出13,252个网格的来源构成,并用相关多臂老虎机加速鲁棒抓取选择。Dex-Net 2.0进一步生成670万点云、抓取和解析质量标签。可核验读数是未知物体实抓成功率、力闭合概率校准与合成—真实误差,而不是库中姿态总数(Mahler 2016)。〔资源预算〕落到复现实务,可为Dex-Net:抓取经验先在合成数据里规模化Dex-Net: Grasp Experience Scales First in Synthetic Data建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“实物未知物体上的校准成功概率/合成标签预测的力闭合概率”统一结算,避免换口径后仍宣称性能提高。

规模会放大假设。刚性物体、库仑摩擦、准确网格和平行夹爪使标签可算,也排除了柔性、透明、功能意图和手内调整。解析指标若与真实失败错位,数据越多,模型反而越确信错误抓法;库中相似网格还可能让测试看似未知、几何上却近邻。Dex-Net 2.0的网络继承了生成器的分布,不能以测试集高分证明现实接触完整。

验收应把合成标签与实物分层:报告每类材料、夹爪、遮挡和位姿误差下的校准曲线,并公开网格来源与去重。功能抓取还要加入任务后果,例如拿杯子喝水与把杯子收走允许不同接触。2026年的姿态无关功能抓取若使用语言或视觉语义,也必须保留力学否决;语义上正确的把手位置可能在当前摩擦和可达性下不可抓。

它与第051号第十条“数据才是瓶颈”相连,却给出一种有条件的反例:真实数据稀缺时,解析物理可先制造标签;与第213号数值分析与科学计算关于模型误差的接口则提醒,合成样本不是免费事实。Open X-Embodiment后来改用真实轨迹跨机器人汇聚,二者的差别正是先验放在标签生成器还是数据分布中;两条路线必须用实物外推共同结算。

位置E——把解析力学假设写入合成标签环境当成抓取规模化的条件 单因决定抓取数据能否规模化的只有未执行动作能否由物理先验生成可信标签 预设〔08 样本覆盖代表机制覆盖〕千万级合成抓取覆盖了真实接触会出现的机制而不只是姿态 量纲实物未知物体上的校准成功概率/合成标签预测的力闭合概率 失效当摩擦与柔性模型错置时,合成样本越多,策略对错误抓法的置信反而越高 自曝资源预算独立核验:Dex-Net 1.0的250万抓取主要属于刚性网格和平行夹爪,不能代表灵巧手与软物体;独立撤回检查落在资源预算 空栏材料属性、物体功能、网格近邻泄漏与失败后再抓的代价没有进入解析标签 异名机器人学称“数据才是瓶颈”;见第051号第十条“数据才是瓶颈”
【第二幕】这一个十年 · 约 2016–2026

第二幕把具身智能推向规模学习。现实不再只是最后一次演示,而被拆成可随机化的分布、可并行的模拟器、可冻结的家庭任务和可汇聚的机器人轨迹;语言与网络视觉进入控制回路,动作开始被表示成token、序列块或连续生成流。规模同时制造新风险:身体分布不均、仿真漏洞、人工复位、长程错误与物理安全会被平均分数遮住。

一、领域随机化:现实被当成模拟分布中的一个样本Domain Randomization: Reality Becomes One Sample from a Simulation Distribution

提出Tobin、Fong、Ray等,2017年《Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World》,arXiv:1703.06907。 争议Hauser, H., Ijspeert, A. J., Füchslin, R. M., Pfeifer, R., & Maass, W. (2012). Towards a theoretical foundation for morphological computation. Biological Cybernetics, 105, 355–370. DOI: 10.1007/s00422-012-0471-0.。 最新(2024年文献)Dai, T., Wong, J., Jiang, Y., et al. (2024). Automated Creation of Digital Cousins for Robust Policy Learning. CoRL. arXiv:2410.07408.。 关键仿真不必复制唯一现实,只要训练分布的变化包住现实中影响控制的变化。

高保真仿真曾被理解为把现实尽量照搬;但纹理、光照、摩擦和相机噪声永远有遗漏,策略一上真机就遇到“现实鸿沟”。Tobin等反过来随机改变模拟纹理、颜色、光源、相机和物体位置,使训练世界故意不逼真。只要变化足够宽,真实图像可能只是模型见过的又一种外观,迁移问题由复刻一个世界改为设计一个覆盖分布。

本条锁定的命题是:决定零样本仿真迁移的只有随机化分布是否包住部署时的因果变化,而不是任何一张模拟图多像照片。若策略学到跨纹理稳定的几何,它可能忽略渲染细节;动力学随机化同理,让质量、摩擦与延迟变化迫使控制器寻找鲁棒反馈。随机范围、相关结构和采样权重因此比渲染审美更接近核心算法(Tobin 2017)。

Tobin等只用非真实随机纹理的模拟RGB图训练物体定位器,真机定位精度达到约1.5厘米,并在杂乱、遮挡条件下执行抓取;作者称其为首批仅用模拟RGB训练而迁到真实机器人控制的结果。Peng等随后随机化动力学完成机器人控制迁移。可核验读数包括实物成功率、现实参数落入训练分布的覆盖和随机化宽度—性能曲线,而不是合成图数量。

“足够随机”没有免费答案。独立均匀采样会产生物理上不可能的组合,浪费容量;范围太窄漏掉现实,太宽又让模型学习保守而低效的策略。若真正偏差来自未建模机制,例如电缆缠绕或材料滞后,已列参数越随机,团队反而越容易误信现实已被覆盖。领域随机化还可能遮住仿真器漏洞,因为平均成功无法指出哪种机制缺失(Tobin 2017)。把领域随机化:现实被当成模拟分布中的一个样本Domain Randomization: Reality Becomes One Sample from a Simulation Distribution与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“随机分布外实物条件的成功率/随机分布内实物条件的成功率”在这些类别上都可回查,跨研究比较才有意义。

工程上应把随机参数注册为可审计分布,用实物小样更新后验,并做单因敏感度与相关随机化;训练后要寻找“最坏现实”而不是只抽平均世界。ACDC的数字近亲路线为真实场景生成多个结构相似的替身,世界基础模型则扩充轨迹,但两者都要标明哪些变化来自数据、哪些由生成器想象。真实回归集不可被反复调参污染(ACDC 2024)。

它与第046号强化学习第四条“模拟器与基准”共享仿真接口,却把目标从同场比较改为跨世界迁移;又与第050号第十二条“数据、偏斜与真实性”对撞:在视觉分类中不真实常是缺陷,在领域随机化中受控不真实可能是正则化。2026年的决定性证据应报告随机分布外的新材料、新相机和新动力学,而不是继续在已知参数范围内加样本。

位置S——把随机化分布的覆盖范围当成Sim2Real迁移的决定性资源 单因决定零样本仿真迁移的只有随机化分布能否包住部署中的因果变化 预设〔05 缺失即不存在〕没有列入随机参数表的现实机制不会主导部署失败 量纲随机分布外实物条件的成功率/随机分布内实物条件的成功率 失效当关键偏差来自未建模机制时,已知参数随机得越宽,对现实覆盖的误判反而越强 自曝外部复算独立核验:1.5厘米定位来自受控物体与相机任务,不能证明随机纹理覆盖全部接触动力学;独立撤回检查落在外部复算 空栏参数相关性、不可模拟故障、真实回归集污染和极端样本权重常不在平均迁移分数里 异名强化学习称“模拟器与基准”;见第046号第四条“模拟器与基准”

二、Habitat:具身导航被扩成每秒万帧的实验学Habitat: Embodied Navigation Scales to Ten Thousand Frames per Second

提出Savva、Kadian、Maksymets等,2019年《Habitat: A Platform for Embodied AI Research》,arXiv:1904.01201。 争议Zhao, T. Z., Kumar, V., Levine, S., & Finn, C. (2023). Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. arXiv:2304.13705.。 最新(2026年文献)Physical Intelligence. (2026). π0.7: General-Purpose, Steerable, and Compositional Robot Policies. Official research report, 16 April 2026.。 关键具身假说只有在传感、场景、任务和指标都能组合并高速重复时,才可能区分算法收益与经验规模。

具身导航早期常在小型游戏或单一室内数据上训练,模拟速度、场景格式和指标各异。一个方法高分,可能只是多看了环境、用了深度传感或终点判定更宽。Habitat把高性能渲染器Habitat-Sim与任务层Habitat-API分开:同一三维场景可配置不同身体与传感器,任务、训练和评价又由统一接口表达。具身AI由零散演示转向可大规模比较的实验平台。

〔反号压力〕本条的单因命题是:决定具身导航结论能否比较的只有场景—传感—任务—指标接口是否共同标准化,而不是单个代理走得多快。平台必须明确代理半径、相机高度、动作步长、是否有深度、终点容差和碰撞处理;否则“找到目标”不是同一事件。模块化接口还允许固定算法,只改变场景数据或传感通道,直接测哪一项贡献了泛化(Habitat 2019)。

Habitat 2019报告:在Matterport3D场景上单线程每秒数千帧,多进程单GPU可超过10,000帧。作者把点目标导航经验放大一个数量级后,发现学习方法相对SLAM的结论会反转;跨Matterport3D与Gibson测试又显示只有带深度的代理稳定泛化。数字表明模拟吞吐改变了可问的问题,也表明传感器配置足以改写算法排名(Savva 2019)。

高速导航会把身体缩成移动相机。早期Habitat忽略真实轮胎打滑、门、可动物体、人的意图和传感时延;在扫描网格上穿行不等于现实机器人能安全通过。训练帧越多,代理越可能利用场景重建瑕疵与离散动作规则。SPL等汇总指标还会把成功、路径效率和探索方式压成一数,遮住碰撞、停错位置与需要人工复位的差异。

复核应固定环境版本并报告训练帧、墙钟时间、能耗、碰撞、路径、成功与跨数据集退化;只报SPL不足。Habitat 3.0加入人形、人在环、社会导航与协作重排,推动平台从空房导航到共同居住,但人类化身仍是行为模型。真实机器人桥接需保留ROS时间、传感噪声和执行器约束,并把模拟—真实动作映射单列(Habitat 3.0 2023)。〔反号压力〕在具身智能的这一对象上,复核应把“跨场景数据集仍成功的导航回合数/同数据集测试的成功回合数”拆成同一分母下的主结果与失败谱,“重建瑕疵、行动延迟、人类让路规则与实机动作映射没有被SPL完整容纳”要单列编码,不能在汇总时并入其他项。

它与第051号第四条“开源生态与仿真器”相接,但本条的核心不是软件开源,而是实验变量可组合;与第258号数据科学的基准治理也同构:数据版本变化会让旧分数失去可比。Habitat证明规模足以反转某些学习—SLAM判断,因此任何“架构胜出”都必须附训练经验量。2026年的前沿是人在环、可动物体和实物迁移共同评价。

位置D——把场景、传感、任务和指标可组合的平台当成具身导航知识累积路径 单因决定导航结论能否比较的只有场景—传感—任务—指标接口是否共同标准化 预设〔01 谁进入分母〕训练帧、传感优势和模拟速度都被纳入算法比较的资源分母 量纲跨场景数据集仍成功的导航回合数/同数据集测试的成功回合数 失效当平台瑕疵比真实动力学更稳定时,训练帧越多,现实部署表现反而越可能下降 自曝反号压力独立核验:Habitat的万帧吞吐主要发生在虚拟移动与渲染,不能代表实物接触和维护成本;独立撤回检查落在反号压力 空栏重建瑕疵、行动延迟、人类让路规则与实机动作映射没有被SPL完整容纳 异名机器人学称“开源生态与仿真器”;见第051号第四条“开源生态与仿真器”

三、ALFRED与BEHAVIOR:成功必须穿过长程家务状态ALFRED and BEHAVIOR: Success Must Survive Long-Horizon Household State

提出Shridhar、Thomason、Gordon等,2020年CVPR论文《ALFRED》,arXiv:1912.01734。 争议Levine, S., Finn, C., Darrell, T., & Abbeel, P. (2016). End-to-End Training of Deep Visuomotor Policies. JMLR, 17, 1–40.。 最新(2026年文献)Physical Intelligence. (2026). Multi-Scale Embodied Memory for Long-Horizon Robot Control. Official research report.。 关键最终回答不能替代环境状态:语言理解只有在一串不可逆动作真正改变家庭世界后才算成功。

视觉—语言任务曾让代理看图回答“椅子在哪里”,导航基准则让它走到坐标;现实家务却要求把目标拆成拿、开、洗、加热、放回等长序列,并承受早期错误的后果。ALFRED把自然语言、第一人称视觉和AI2-THOR交互接成家庭任务,某一步把杯子放错或切坏物体,后续无法用一段正确文本补救。评价对象从答案转为世界状态。

本条锁定的命题是:决定具身语言理解是否成立的只有动作序列能否把环境推进到可验证目标状态,而不是指令解释听起来多合理。语言必须绑定对象身份、空间关系、可供性和先后约束;身体还需重新观察动作结果,处理不可逆变化。一个代理即使能复述步骤,只要没有把洗净杯放进咖啡机,就没有完成“理解”(ALFRED 2020)。

ALFRED包含约25,000条自然语言指令,既有高层目标也有逐步描述,任务序列和动作空间显著长于此前具身视觉语言数据;首批基线在未见场景表现很低。BEHAVIOR进一步定义100项日常活动、1,000种物体和可检查状态条件。读数应包括整任务成功、目标条件完成比例、路径长度、无效动作与未见场景退化,而非只算子目标平均。

模拟家务也会教会代理错误常识。对象状态转换由引擎枚举,布料、液体、拥挤抽屉和人类临时介入被简化;任务脚本越精确,模型越可能学习基准语法而非物理因果。长程全成功指标又很苛刻:最后一步失败会把前面正确工作记为零;但只报子目标平均,则可能奖励永远不收尾的代理。基准排行榜因此不能替代失败轨迹审阅(ALFRED 2020)。

成熟评测应同时保留全成功、目标条件、人工介入、重试、碰撞与不可逆损坏,并冻结环境镜像与随机种子。训练指令要与测试表述、房型和物体组合去重,防止语言模板泄漏。ReALFRED 2024把任务放入真实扫描的大型多房间场景,缩小视觉域差,却仍不等于实物接触;2026 BEHAVIOR Challenge的100项双手任务仍应报告手动复位与模拟捷径。

它与第051号第十一条“评估的困难”构成具体化接口:机器人学知道评测难,本条把“难”落到可检查环境状态与长程轨迹。又与第532号第十八条“AgentBench、WebArena与GAIA:最终答案让位于真实轨迹”形成数字—物理异名:网页代理改数据库,具身代理改物体状态;两者都要求回滚、重放和过程成本。对ALFRED与BEHAVIOR:成功必须穿过长程家务状态ALFRED and BEHAVIOR: Success Must Survive Long-Horizon Household State而言,真正需要登记的不是又一个平均分,而是由“决定具身语言理解是否成立的只有动作能否把环境推进到可验证目标状态”推出的每一步中介、责任人和可撤回条件;〔责任链〕缺少任何一环,都不能把相关性写成机制。

位置E——把不可逆家庭状态与整条轨迹当成语言理解的外部裁决者 单因决定具身语言理解是否成立的只有动作能否把环境推进到可验证目标状态 预设〔02 单一读数代表复杂对象〕整任务成功率可以代表语言、视觉、规划、接触与恢复的全部能力 量纲无需复位达到全部目标条件的任务数/全部启动的长程家庭任务数 失效当任务脚本与状态机被模型记住时,基准成功率越高,真实家庭的相对泛化反而越低 自曝责任链独立核验:ALFRED的25,000条指令运行在枚举状态的AI2-THOR中,物理接触仍由引擎代办;独立撤回检查落在责任链 空栏人工复位、物体损坏、家庭成员打断和最后一步失败前已完成的有效工作常被总分抹平 异名智能体工程称“最终答案让位于真实轨迹”;见第532号第十八条“AgentBench、WebArena与GAIA:最终答案让位于真实轨迹”

四、Isaac Gym:机器人试错进入GPU原生并行Isaac Gym: Robot Trial-and-Error Becomes GPU-Native

提出Makoviychuk、Wawrzyniak、Guo等,2021年《Isaac Gym》,arXiv:2108.10470。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2025年文献)OXE-AugE Collaboration. (2025). Augmenting Open X-Embodiment for Unseen Robot Transfer. Preprint.。 关键物理、奖励与策略若留在同一GPU内存,机器人学习速度可由数据搬运瓶颈转成并行环境设计问题。

传统强化学习仿真常由CPU推进成百上千个环境,再把观测复制到GPU训练网络;接触丰富、自由度高的人形任务会被通信和串行物理拖慢。Isaac Gym把PhysX仿真、状态张量、奖励计算与PyTorch策略都放在GPU,避免每步穿过CPU。数千副虚拟身体可同步跌倒、起身和抓取,机器人试错从分布式机器集群转为单GPU上的张量流水线。〔排除规则〕机构采用Isaac Gym:机器人试错进入GPU原生并行Isaac Gym: Robot Trial-and-Error Becomes GPU-Native之前还应公布否决门槛:一旦“当数千环境复制同一物理偏差时,并行度越高,错误动力学上的置信反而越快形成”出现,就暂停扩张并回到“物理、奖励与策略若留在同一GPU内存,机器人学习速度可由数据搬运瓶颈转成并行环境设计问题”的原始记录复核,该门槛必须早于部署决定写入方案。

〔排除规则〕本条的单因命题是:决定大规模具身强化学习速度的只有物理状态与策略更新能否在同一加速器内零拷贝并行,而不是单个环境求解多快。若每步都跨总线搬运,小模拟器的吞吐会被调度吃掉;张量接口则允许奖励、观测和控制批量计算。研究者由此能在数分钟内比较课程、奖励和随机化,而非等待数日(Isaac Gym 2021)。

Isaac Gym论文报告相对CPU仿真加GPU训练的传统管线有2–3个数量级加速,并在Ant、Humanoid、Franka叠方块、Shadow Hand、ANYmal等8类环境展示单GPU训练。Rudin等用数千个并行四足环境把行走策略训练压到分钟级。可核验读数包括每秒仿真步、达到阈值的墙钟时间、GPU能耗和实机转移,而非只报环境数量。

海量并行会改变学习统计。极大批量降低墙钟时间,却可能需要更多总样本;同一PhysX偏差在数千环境复制,形成相关错误而非多样证据。奖励在GPU上写得越方便,团队越可能堆密集塑形项,策略则学习不可见捷径。若只比较分钟数,昂贵GPU、调参次数和真实校准成本会被移出分母,速度结论反而夸大。

验收应同时报告墙钟、总样本、硬件型号、能耗、并行数、随机分布和真实机器人成功;改变并行度后还要检查策略质量是否稳定。Isaac Lab 2025加入执行器模型、多频传感、人类示范和跨形态任务,说明GPU原生不再只是一台训练器,而是数据生产线。2026年人形流程仍需真实接触回归,不能以合成小时替代实机风险。

它与第351号高性能与并行计算第一幕丁“任务图运行时:并行次序应由依赖关系生成”共享同一系统动作:把依赖留在设备、减少搬运;但本条的输出是具身策略,任何吞吐收益都要回到实机结算。与第046号强化学习第六条“还没解决的”对接时,可见样本效率、奖励错置与安全没有因GPU加速而消失,只是更快暴露。

位置S——把GPU内物理—奖励—策略闭环当成训练速度的决定性系统单元 单因决定具身强化学习速度的只有物理状态与策略更新能否零拷贝并行 预设〔03 有限近似控制无限对象〕同一PhysX内数千环境足以近似现实身体与接触的开放分布 量纲达到同一实机成功阈值所需墙钟小时/传统CPU—GPU管线所需小时 失效当数千环境复制同一物理偏差时,并行度越高,错误动力学上的置信反而越快形成 自曝排除规则独立核验:2–3个数量级是仿真训练吞吐,不包含实机标定、故障和奖励设计时间;独立撤回检查落在排除规则 空栏GPU能耗、调参总轮次、相关模拟误差与真实复位成本常被分钟级训练叙事排除 异名高性能计算称“任务图运行时”;见第351号第一幕丁“任务图运行时:并行次序应由依赖关系生成”

五、SayCan:语言计划必须乘上身体可供性SayCan: Language Plans Must Be Multiplied by Physical Affordance

提出Ahn、Brohan、Brown等,2022年《Do As I Can, Not As I Say》,arXiv:2204.01691;PMLR 205:1–25。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2026年文献)Physical Intelligence. (2026). Multi-Scale Embodied Memory for Long-Horizon Robot Control. Official research report.。 关键语言模型提出的下一步只有与当前身体可执行概率相乘,才从常识句子变成动作候选。

大语言模型知道“洒了饮料要清理”,却不知道眼前机器人是否够得到海绵、夹爪能否拿起罐子、哪项技能已训练。单让模型列步骤会产生语义合理、身体不可行的计划。SayCan把两类分数相乘:语言模型评估某项技能对指令是否有用,机器人价值函数评估当前状态下该技能能否执行;每完成一步再观察并重排候选。

〔基线冻结〕本条的单因命题是:决定语言知识能否进入机器人行动的只有候选步骤是否被当前身体可供性逐步否决,而不是语言模型拥有多少世界常识。语言负责“该做什么”,低层技能的价值负责“此刻能不能”;乘积把语义与物理交集变成可解释选择。若没有Can,模型会要求没有的手段;若没有Say,技能库只能在有限目标间枚举(SayCan 2022)。〔基线冻结〕面向下一轮材料,具身智能应优先补齐“技能校准漂移、失败后的环境改变、权限与不可逆物体损伤没有进入语言有用度”的原始记录,并把“当价值函数对分布外状态过度自信时,语言计划越合理,危险动作获得的可信包装反而越强”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

PaLM-SayCan在真实移动机械臂的101项厨房指令上取得84%计划成功率与74%执行成功率,比仅用PaLM的计划高,并显著优于不带强语言模型的组合;在更陌生真实厨房中报告81%计划、60%执行。计划与执行之间10个百分点以上的差距本身就是具身读数:语义选对不等于物理完成。每项技能分数还允许审阅者看见是“有用”还是“可行”压低候选。

可供性只覆盖技能库会做的事。若价值函数对分布外场景过度自信,乘法会把错误可行性包装成可靠计划;若每项技能都经人工命名和训练,语言模型并没有创造新动作。技能越细,计划步数和误差累积越大;技能越粗,可供性分数越难校准。一次失败还可能改变环境,使原有分数全部过期(SayCan 2022)。

工程上应校准每项技能的成功概率,保存评估状态与版本,并在执行后用传感证据验证目标条件;值函数不能既提议又自证。遇到库外指令,系统应明确拒绝或请求教学,而不是找语义最像的危险技能。Gemini Robotics ER 2在2026年7月加入连续进度判断、工具编排和多机器人协作,仍应由每副身体的低层安全控制器独立否决。

它与第532号第十三条“ReAct:推理与行动改成观察驱动的交替循环”共享逐步回写,但本条多出身体可供性这一门;网页工具失败可以重试,抓错易碎物可能不可逆。与第253号第九条“自然语言作为界面”对接时,还要区分表达意图和授权动作。具身系统必须显示是哪一项物理能力支持了语言计划,而不能让语言流畅替能力担保。

位置D——把语言有用度与身体可行度逐步相乘当成落地路径 单因决定语言知识能否进入行动的只有每个候选步骤是否被当前身体可供性否决 预设〔04 测量不改变被测对象〕执行一个技能后环境变化不会使其余可供性估计失真 量纲最终物理执行成功的指令数/语言规划被判成功的指令数 失效当价值函数对分布外状态过度自信时,语言计划越合理,危险动作获得的可信包装反而越强 自曝基线冻结独立核验:SayCan只能编排预训练技能库,84%的计划成功没有创造库外身体能力;独立撤回检查落在基线冻结 空栏技能校准漂移、失败后的环境改变、权限与不可逆物体损伤没有进入语言有用度 异名智能体工程称“观察驱动的交替循环”;见第532号第十三条“ReAct:推理与行动改成观察驱动的交替循环”

六、RT-1:真实机器人轨迹第一次支撑单一多任务策略RT-1: Real-Robot Trajectories Support One Multi-Task Policy

提出Brohan、Brown、Carbajal等,2022年《RT-1: Robotics Transformer for Real-World Control at Scale》,arXiv:2212.06817;RSS 2023。 争议Levine, S., Finn, C., Darrell, T., & Abbeel, P. (2016). End-to-End Training of Deep Visuomotor Policies. JMLR, 17, 1–40.。 最新(2026年文献)Physical Intelligence. (2026). π0.7: General-Purpose, Steerable, and Compositional Robot Policies. Official research report, 16 April 2026.。 关键机器人能力若要出现规模效应,真实轨迹必须以统一动作接口、语言标注和持续采集汇入同一策略。

机器人学习长期一任务一模型:开抽屉、拿罐子、放海绵分别采数据、训练和部署,经验不能复用。RT-1把多台同型移动机械臂的相机图、语言指令与离散动作token交给Transformer,用单一网络覆盖数百技能。数据不再只是某个实验的附件,而成为持续17个月、由机器人群采集的多任务运行资产。

本条锁定的命题是:决定真实机器人是否出现规模泛化的只有异质任务轨迹能否在统一动作词表中共同训练,而不是每项技能各自有多强。共享策略可从“拿可乐”迁移到新物体,从多种放置任务学到抓取先验;统一token使不同时间步与语言条件进入同一序列模型。规模效应因此同时依赖数据量、任务多样性与接口一致性(RT-1 2022)。

RT-1数据由13台EDR机器人在17个月采集,含超过130,000个回合和700多项任务;平台有7自由度手臂、双指夹爪与移动底座。论文报告见过的训练指令约97%成功,并在新任务、干扰物和新环境上优于BC-Z与Gato;接入SayCan后在Kitchen1执行成功率67%。这些数字把数据规模与现实机器人表现第一次放进同一消融(RT-1 2022)。〔异常运行〕证据链还要把Brohan、Brown、Carbajal等,2022年《RT-1: Robotics Tran的起点材料与更新文献放在同一比较表里,并逐项报告“机器人能力若要出现规模效应,真实轨迹必须以统一动作接口、语言标注和持续采集汇入同一策略”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

统一词表也会统一偏差。13台机器人形态相同、场景主要围绕两间厨房,700项指令可能是物体—动作重组而非700种机制;遥操作员的习惯成为策略默认。数据越大,常见拿放动作越支配梯度,稀有失败与安全恢复反而被淹没。97%的“见过任务”不能外推到新夹爪、软物体或长程协作。

工程上应公开任务频率、操作者、机器人实例、失败轨迹与动作token定义,并按时间和场景做严格切分。扩容时要报告新增数据的边际收益,而不是只报总回合;对稀有但危险状态应重采或加权。GR00T N1到1.7把语言图像策略迁向多种人形,仍须证明动作规范化没有抹掉关节限位、接触与整机安全差异(GR00T 1.7 2026)。对RT-1:真实机器人轨迹第一次支撑单一多任务策略RT-1: Real-Robot Trajectories Support One Multi-Task Policy而言,真正需要登记的不是又一个平均分,而是由“决定真实机器人能否规模泛化的只有异质任务轨迹能否在统一动作词表共同训练”推出的每一步中介、责任人和可撤回条件;〔异常运行〕缺少任何一环,都不能把相关性写成机制。

它与第051号第九条“跨形态数据池与视觉-语言-动作模型”相邻但不重讲:该条概览跨形态方向,本条聚焦跨任务规模在同形态上如何先成立。也与第044号第八条“预训练、涌现与「基础模型」”对撞:语言模型的token来自文本,RT-1的token要落到电机并承担失败成本。所谓机器人基础模型必须把数据分母写成真实动作小时(RT-1 2022)。

位置E——把统一动作词表、语言标注与真实机器人群的数据分布当成规模条件 单因决定真实机器人能否规模泛化的只有异质任务轨迹能否在统一动作词表共同训练 预设〔05 缺失即不存在〕130,000回合未覆盖的身体状态不会主导部署风险 量纲严格新环境与新物体成功率/见过任务和场景的成功率 失效当常见拿放轨迹支配训练时,数据总量越大,稀有恢复能力的相对学习反而越弱 自曝异常运行独立核验:RT-1的13台机器人共享一种EDR形态,跨任务不等于跨身体;独立撤回检查落在异常运行 空栏遥操作员差异、失败回合、机器人磨损与人工复位没有被130,000这一总量揭示 异名机器人学称“跨形态数据池与视觉-语言-动作模型”;见第051号第九条“跨形态数据池与视觉-语言-动作模型”

七、PaLM-E:连续传感被注入语言模型的词向量空间PaLM-E: Continuous Sensor Streams Enter the Language Embedding Space

提出Driess、Xia、Sajjadi等,2023年ICML论文《PaLM-E》,PMLR 202:8469–8488,arXiv:2303.03378。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2026年文献)Physical Intelligence. (2026). Multi-Scale Embodied Memory for Long-Horizon Robot Control. Official research report.。 关键视觉、状态估计与文本若被编码为同一序列,互联网知识可进入具身推理,但连续动作仍需身体控制层落地。

语言模型拥有大量程序与物体常识,却把机器人相机、关节状态和三维表示视为词表之外的连续信号。PaLM-E用编码器把图像、状态和神经场等观测投到语言embedding维度,与文本token交错输入解码器。机器人可以在一句多模态“句子”中读指令、看场景、保留状态并输出计划,感知与语言不再只在末端API相接。

〔人工接管〕本条的单因命题是:决定互联网知识能否参与具身推理的只有连续传感是否被注入预训练语言模型的共同表示空间,而不是另接一个物体分类器。共同序列允许词义受当前图像约束,也让机器人问题从固定标签扩展到开放问答、计划与多图推理。跨任务联合训练若产生正迁移,说明语言与视觉先验可以减少每副身体从零学习的负担(PaLM-E 2023)。

PaLM-E在多副机器人、视觉问答与图像描述上联合训练,最大版本把540B PaLM与22B视觉Transformer结合为562B参数;同一checkpoint在具身推理之外还取得当时OK-VQA领先结果,并出现未专门训练的多图零样本能力。读数证明共同表示可承载不同模态,也暴露成本:562B规模远超多数机器人实时部署预算。

表示空间统一不等于物理统一。语言模型可能正确描述“抓把手”,却不了解当前夹爪摩擦、关节限位和控制频率;PaLM-E的机器人输出多为高层计划,仍调用已有低层策略。参数越大,语言流畅与世界知识越容易让观察者高估动作能力。持续传感压成token还可能丢掉高速接触,长上下文延迟则与实时安全冲突。〔人工接管〕本条的边界案例应从“推理延迟、传感采样率、夹爪摩擦与低层安全控制器的贡献没有进入OK-VQA读数”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当低层接触信息被token压缩丢失时,语言推理越强,观察者对真实动作能力的高估反而越大”究竟是偶发噪声,还是足以改变结论方向的系统反例。

部署应把高层推理和低层控制分账:记录哪些观测进入模型、编码频率、上下文延迟、调用了哪项技能与谁验证成功。对空间推理要用多视角、遮挡、尺度和反事实物体测试,不以VQA分数代替操作。Gemini Robotics ER 2在2026年报告视频进度分类与事件定位改进,仍应由独立控制器执行碰撞、力和稳定限制。

它与第044号第八条“预训练、涌现与「基础模型」”使用同一规模逻辑,但具身侧多出传感时钟与动作后果;与第050号第十条“视觉与语言合流之后”相比,本条要求连续状态进入并影响计划。真正的跨域正迁移应在固定机器人数据量下提高未知场景成功,而不是只让模型同时参加更多数字基准(PaLM-E 2023)。

位置S——把连续传感与语言token的共同表示当成互联网知识落地的决定性载体 单因决定互联网知识能否参与具身推理的只有连续传感能否进入语言模型共同表示空间 预设〔06 通过形式审查=实质合规〕在多模态问答与计划上通过评测足以代表真实身体可执行 量纲固定机器人数据量时未知场景任务成功率/不使用互联网预训练的同规模模型成功率 失效当低层接触信息被token压缩丢失时,语言推理越强,观察者对真实动作能力的高估反而越大 自曝人工接管独立核验:562B PaLM-E主要证明共同表示与高层推理,机器人控制仍依赖预训练低层技能;独立撤回检查落在人工接管 空栏推理延迟、传感采样率、夹爪摩擦与低层安全控制器的贡献没有进入OK-VQA读数 异名基础模型研究称“预训练、涌现与基础模型”;见第044号第八条“预训练、涌现与「基础模型」”

八、RT-2:动作被写成视觉语言模型的另一种语言RT-2: Actions Become Another Language for Vision-Language Models

提出Brohan、Brown、Carbajal等,2023年CoRL论文《RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control》,PMLR 229:2165–2183。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2025年文献)Physical Intelligence. (2025). π0.5: A Vision-Language-Action Model with Open-World Generalization. arXiv:2504.16054.。 关键若机器人动作可被token化并与网页视觉语言共同训练,语义概念可能直接改变控制输出。

RT-1证明真实轨迹可训练多任务策略,但没见过的“把苹果放到同色盘子”需要颜色关系、类别和用途等网页知识。RT-2把连续机器人动作离散为文本样式token,与图像、语言指令和互联网视觉语言样本共同微调;动作串成为视觉语言模型可以生成的一种新语言。预训练不再只给高层规划器建议,而直接影响末端执行器下一段控制(RT-2 2023)。

本条锁定的命题是:决定网页语义能否直接迁入控制的只有动作是否进入视觉语言模型的统一token目标,而不是在外部另写语义规划器。共同训练保留原有视觉语言数据,避免机器人小数据完全覆盖世界知识;模型可把“可当锤子的物体”这类概念映到抓取选择。动作表示因此成为知识传递的接口,而非单纯编码技巧(RT-2 2023)。

RT-2在约6,000次真实机器人评估中,保持见过任务表现,并把未见对象、背景和环境上的成功率从RT-1约32%提高到62%;PaLI-X 55B版本在未出现在机器人数据的符号理解、推理和人类识别等涌现测试上平均接近60%。动作示例可表示为一串离散数字token,统一训练让VLM知识进入VLA输出(RT-2 2023)。

token相同不等于动力学相同。离散化会牺牲微小力与高频平滑,网络可能生成语法合法却越过关节或速度限制的动作;互联网知识还包含偏见与错误物理常识。未见任务从32%到62%仍意味着约四成失败,若只展示成功涌现,语义惊喜会遮住碰撞和停机。大模型延迟也可能让闭环观察过期。

工程上要公布动作量化误差、控制频率、推理延迟、低层滤波和安全否决次数,并以连续控制基线对照。测试需把语义新颖性与物理新颖性拆开:新颜色旧抓法、新物体旧几何、新技能新接触分别计分。Gemini Robotics 2与GR00T N1.7在2026年扩展全身人形控制,仍要按身体校准动作解码器,不能把一套token当成通用关节语言。〔撤回门槛〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定网页语义能否直接迁入控制的只有动作是否进入视觉语言模型统一token目标”的操作定义,仍能复算“物理执行无越界的动作块数/模型生成语法合法的全部动作块数”,否则所谓转向可能只是数据管线或命名变化。

它与第051号第九条“跨形态数据池与视觉-语言-动作模型”是直接异名,本条把VLA的关键缝隙定位在动作token;与第249号编程语言与编译关于中间表示的逻辑也相通:统一表示利于迁移,却需要类型检查和目标机约束。机器人动作若没有身体类型、单位与权限,token化只把危险控制伪装成文本生成。

位置D——把动作token化、共同微调与按身体解码组成知识迁移路径 单因决定网页语义能否直接迁入控制的只有动作是否进入视觉语言模型统一token目标 预设〔06 通过形式审查=实质合规〕生成语法合法的动作token就等于满足身体动力学与安全约束 量纲物理执行无越界的动作块数/模型生成语法合法的全部动作块数 失效当离散动作丢掉高频接触反馈时,token预测越流畅,精细操作的现实成功率反而越低 自曝撤回门槛独立核验:RT-2将未见场景成功率提高到62%仍留下约四成失败,且测试集中于一种移动机械臂;独立撤回检查落在撤回门槛 空栏动作量化误差、推理延迟、低层滤波与安全控制器介入没有被涌现能力均分揭示 异名机器人学称“视觉-语言-动作模型”;见第051号第九条“跨形态数据池与视觉-语言-动作模型”

九、Open X-Embodiment:跨机器人经验获得共同格式Open X-Embodiment: Cross-Robot Experience Gets a Common Format

提出Open X-Embodiment Collaboration,2023年《Open X-Embodiment: Robotic Learning Datasets and RT-X Models》,arXiv:2310.08864。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2024年文献)Octo Model Team. (2024). Octo: An Open-Source Generalist Robot Policy. RSS. arXiv:2405.12213.。 关键跨实验室数据若要共同训练,必须先把观测、任务、动作与机器人元数据翻译成可追踪的共同格式。

机器人数据长期锁在单个实验室:相机命名、动作单位、夹爪语义、控制频率和任务标签各不相同,简单拼接会把同一数字解释成不同身体动作。Open X-Embodiment让34个实验室协作,将60个数据集的观测与动作映射到共同结构;汇集超过100万条轨迹、22种机器人形态。它把“共享机器人经验”从口号改成数据工程问题(Open X 2023)。

〔跨域外推〕本条的单因命题是:决定跨身体学习能否成立的只有异构轨迹能否被翻译为保留身体语义的共同表示,而不是把更多数据目录放在一起。图像与语言容易共用张量,末端位姿、关节速度和夹爪开合却必须注明坐标系、单位与控制模式;共同格式若丢掉这些类型,模型看到的是数量,不是可执行经验(RT-X 2023)。〔跨域外推〕证据链还要把Open X-Embodiment Collaboration,2023年《Open X-Emb的起点材料与更新文献放在同一比较表里,并逐项报告“跨实验室数据若要共同训练,必须先把观测、任务、动作与机器人元数据翻译成可追踪的共同格式”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

RT-X在该数据池上联合训练,并以22种形态、527种技能和160,266项任务标签构成跨域检验;研究报告RT-1-X在多数参与平台优于各自仅用本地数据的基线,RT-2-X还显示视觉语言知识与跨身体数据可以叠加。关键读数不是总轨迹数,而是留出某副机器人后,它的少量微调数据能否换来更高真实成功率(Open X 2023)。

共同格式会隐藏数据权力差。高频Franka或Google系平台的拿放轨迹可能支配梯度,稀有夹爪、柔性体和力控制只剩少量样本;动作归一化还会把尺寸、速度上限与机械间隙压平。当主流形态偏差被复制时,池子越大,少数身体的错误先验反而越牢,表面跨形态提升可能只是对相似机械臂的迁移(Octo 2024)。

数据卡应逐轨迹保存机器人型号、末端工具、坐标系、控制频率、操作者、许可、失败与复位,并分别报告同形态、近形态和未见形态成绩。OXE-AugE在2025年把池子扩到440万条轨迹及9种增强形态,未见机器人—夹爪微调提升约24%–45%;这仍需以真实碰撞、力和恢复测试确认,不能只看动作回放相似度。

它与第051号第九条“跨形态数据池与视觉-语言-动作模型”共享对象,本条只追问共同格式怎样决定可迁移边界;也与第050号第十二条“数据、偏斜与真实性”对撞:机器人的缺失不是图片类别少,而是某些身体从未产生失败轨迹。2023年的60个数据集是开放起点,不是统一身体语义已经完成的证明。〔跨域外推〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当主流机械臂轨迹支配共同表示时,池子越大,稀有形态的动作偏差反而越难纠正”做至少两轮外部复算,若方向翻转,Open X-Embodiment:跨机器人经验获得共同格式Open X-Embodiment: Cross-Robot Experience Gets a Common Format的结论必须随之收窄。

位置E——把共同格式、形态元数据与跨实验室轨迹分布当成跨身体学习土壤 单因决定跨身体学习能否成立的只有异构轨迹能否翻译为保留身体语义的共同表示 预设〔01 谁进入分母〕进入60个数据集的22种形态被默认代表机器人身体的开放总体 量纲留出整副机器人后经少量微调成功的任务数/该机器人全部测试任务数 失效当主流机械臂轨迹支配共同表示时,池子越大,稀有形态的动作偏差反而越难纠正 自曝跨域外推独立核验:Open X的百万级规模由不同采集协议拼成,统一字段没有自动统一任务难度与失败定义;独立撤回检查落在跨域外推 空栏未上传失败、许可证限制、操作者风格、机械磨损与坐标转换误差没有被总轨迹数呈现 异名机器人学称“跨形态数据池与视觉-语言-动作模型”;见第051号第九条“跨形态数据池与视觉-语言-动作模型”

十、Diffusion Policy:动作分布变成条件去噪轨迹Diffusion Policy: Action Distributions Become Conditional Denoising Trajectories

提出Chi、Feng、Du等,2023年RSS论文《Diffusion Policy: Visuomotor Policy Learning via Action Diffusion》,后发表于《IJRR》。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2024年文献)Dai, T., Wong, J., Jiang, Y., et al. (2024). Automated Creation of Digital Cousins for Robust Policy Learning. CoRL. arXiv:2410.07408.。 关键示范中多种可行动作不应被回归成一个平均动作,而应作为条件轨迹分布逐步去噪采样。

行为克隆常用均方误差预测下一动作;面对“从杯子左边绕”与“从右边绕”两种都正确的示范,回归会平均出撞向杯子的中间路线。Diffusion Policy先给一段动作序列加噪,再依据视觉与机器人状态迭代去噪,最终采出一条内部一致的轨迹。动作策略由单点估计变成条件生成分布(Diffusion Policy 2023)。〔盲法复核〕落到复现实务,可为Diffusion Policy:动作分布变成条件去噪轨迹Diffusion Policy: Action Distributions Become Conditional Denoising Trajectories建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“遇到未见扰动后仍完成的多峰轨迹数/全部扰动测试轨迹数”统一结算,避免换口径后仍宣称性能提高。

〔盲法复核〕本条的单因命题是:决定多峰操作示范能否被忠实学习的只有策略是否显式生成整段条件动作分布,而不是把互斥动作压成条件均值。时间卷积或Transformer一次表示多个未来步,滚动时只执行前一小段再重看环境;动作块提供时间一致性,重规划保留反馈,去噪过程则可从不同初始噪声选择不同可行模式(IJRR 2024)。

原论文在Push-T、Robomimic、Franka Kitchen与真实机器人等4组基准、12项任务比较,平均成功率相对既有方法提高46.9%;其中Push-T的T形块需要绕障和精确入位,直观显示多峰轨迹优于平均动作。核验时还应报告20次以上随机种子与初始状态的成功分布、控制频率和单步推理毫秒数,而非只给最佳视频。〔盲法复核〕本条的边界案例应从“采样能耗、操作者风格、动作块内碰撞与安全控制器否决次数没有进入平均成功率”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当环境变化快于去噪与动作块重规划时,采样越精细,执行依据的观测反而越陈旧”究竟是偶发噪声,还是足以改变结论方向的系统反例。

扩散采样不是免费推理。多轮去噪会增加延迟;开放环境在采样期间已变化,生成的长动作块可能追逐过期观测。训练示范若偏向一种操作者风格,生成分布只会精细复制该偏见。动作块越长,平滑性越好,意外接触后的反馈反而越迟;去噪步越少,实时性提高却可能丢掉多峰质量(Diffusion Policy 2023)。

部署应联合标定采样步数、预测时域、执行时域和安全控制频率,记录每次重规划前后的观测年龄;力、碰撞和关节限位必须由高频独立控制层否决。比较基线要固定示范数、视觉编码器和算力,并用障碍突变、目标移动、相反示范及延迟注入测闭环恢复。Consistency Policy 2024只有在真实延迟下降且成功不退化时才算工程进展。

它与第045号生成模型第八条“把生成变成可控的采样”同源,但图像生成的错误像素可重采,机器人错误轨迹已经改变世界;也与第051号第八条“模仿学习先跑通了”相接,本条把示范的多解性放到分布中心。46.9%的平均提升是方法锚点,不能替代每项任务的方差、失败模式和现实推理时钟。

位置S——把条件动作轨迹的生成分布当成多峰示范得以显露的决定性表示 单因决定多峰操作示范能否被忠实学习的只有策略是否生成整段条件动作分布 预设〔02 单一读数代表复杂对象〕12项任务的平均成功提升足以代表延迟、恢复与安全共同改善 量纲遇到未见扰动后仍完成的多峰轨迹数/全部扰动测试轨迹数 失效当环境变化快于去噪与动作块重规划时,采样越精细,执行依据的观测反而越陈旧 自曝盲法复核独立核验:46.9%是跨任务平均增益,掩盖不同基准、随机种子和真实控制频率的差别;独立撤回检查落在盲法复核 空栏采样能耗、操作者风格、动作块内碰撞与安全控制器否决次数没有进入平均成功率 异名生成模型称“把生成变成可控的采样”;见第045号第八条“把生成变成可控的采样”

十一、ALOHA与ACT:低成本双臂把示范数据做成基础设施ALOHA and ACT: Low-Cost Bimanual Demonstration Becomes Infrastructure

提出Zhao、Kumar、Levine与Finn,2023年《Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware》,arXiv:2304.13705。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2024年文献)Dai, T., Wong, J., Jiang, Y., et al. (2024). Automated Creation of Digital Cousins for Robust Policy Learning. CoRL. arXiv:2410.07408.。 关键精细双臂学习的瓶颈可以从昂贵设备转向可复制遥操作台,但硬件同步与示范协议成为数据质量的一部分。

拉拉链、穿魔术贴和双手传递电池需要两臂同步、细小接触与长时序,传统工业示教设备昂贵且难复制。ALOHA用低成本从臂直接遥操作两台从动机械臂,把操作者的双手轨迹同步记录;ACT再用动作块Transformer预测未来一段动作,并以潜变量吸收同一任务的风格差异。采集硬件与学习算法被共同设计(ALOHA 2023)。

〔结果分母〕本条的单因命题是:决定精细双臂模仿能否扩展的只有低成本、低延迟且动作同构的遥操作链能否持续产生同步示范,而不是单独换一个更大模型。操作者移动的关节与机器人执行关节直接对应,减少逆运动学和穿戴设备映射;ACT用动作块降低长轨迹中的逐步误差,数据采集因此成为可重复基础设施(ACT 2023)。把ALOHA与ACT:低成本双臂〔结果分母〕把示范数据做成基础设施ALOHA and ACT: Low-Cost Bimanual Demonstration Becomes Infrastructure与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“更换操作者和从臂后仍一次完整成功的任务数/原平台成功任务数”在这些类别上都可回查,跨研究比较才有意义。

团队用约20,000美元硬件测试6项精细任务,每项通常只采约10分钟示范,ACT在多项任务达到80%–90%成功,并显著优于逐动作行为克隆;透明糖果包装、拉链和电池槽等任务要求毫米级协同。复核应给出每项演示条数、独立初始状态、至少50次实机试验及无人扶正的完整成功,而非把剪辑后片段作为分母。

低成本也会把机械间隙、摩擦和标定漂移写进数据。主从臂同构使采集容易,却限制到不同臂长、夹爪和负载的迁移;操作者可凭触觉与经验预判,从动侧相机未必包含这些信息。动作块越长,示范看上去越平滑,遇到拉链卡住或物体滑动时,闭环纠正反而可能被块内开环执行推迟(ALOHA 2023)。〔结果分母〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定精细双臂模仿能否扩展的只有可复制遥操作链能否持续产生同步示范”的操作定义,仍能复算“更换操作者和从臂后仍一次完整成功的任务数/原平台成功任务数”,否则所谓转向可能只是数据管线或命名变化。

平台验收需把零件清单、固件、控制频率、通信延迟、机械回差、相机与关节校准一同版本化;成功数据旁必须保存卡滞、掉落和人工扶正。改变操作者、负载和从臂后复测,才能区分算法与装置默契。Mobile ALOHA在2024年加入移动底盘和全身遥操作,使家务范围扩大,也让底盘—双臂同步、人体安全和长程复位成为新分母。

它与第051号第八条“模仿学习先跑通了”共享示教路线,但本条把采集装置本身视为模型能力的前置条件;与第255号第十八条“从创造到验证的转移”对撞时,低成本复制应转化为跨实验室复现,而非更多单团队视频。2023年的6项任务与10分钟示范是效率锚点,不是家庭开放世界覆盖。

位置D——把同构遥操作、同步记录与动作块学习组成精细双臂数据路径 单因决定精细双臂模仿能否扩展的只有可复制遥操作链能否持续产生同步示范 预设〔03 有限近似控制无限对象〕6项精细任务与少量操作者足以近似家庭双臂接触的开放分布 量纲更换操作者和从臂后仍一次完整成功的任务数/原平台成功任务数 失效当机械回差或接触突变超过动作块反馈速度时,块越长,卡滞后的错误动作反而累积越多 自曝结果分母独立核验:80%–90%成功依赖同构主从硬件、短任务与团队标定,低价格没有消除平台特异性;独立撤回检查落在结果分母 空栏失败示范、人工扶正、操作者疲劳、零件磨损与跨实验室校准成本未被10分钟叙事计入 异名机器人学称“模仿学习先跑通了”;见第051号第八条“模仿学习先跑通了”

十二、π0到π0.7:通用策略开始组合未见身体技能From π0 to π0.7: General Policies Compose Unseen Physical Skills

提出Black、Brown、Driess等,2024年《π0: A Vision-Language-Action Flow Model for General Robot Control》,arXiv:2410.24164。 争议Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.。 最新(2026年文献)Physical Intelligence. (2026). π0.7: General-Purpose, Steerable, and Compositional Robot Policies. Official research report, 16 April 2026.。 关键通用具身策略若要越过任务记忆,必须把多身体经验、语言意图、动作生成与长程记忆组合成可检验的新技能。

π0把互联网视觉语言预训练与来自8种机器人形态的动作数据接入flow-matching动作专家,让同一策略执行折衣、清桌、装盒等不同灵巧任务。π0.5再用跨任务、跨环境和网页数据共训练,目标是进入从未见过的家庭。研究焦点由“一个模型做很多已采任务”移到“数据中分散出现的能力能否在新身体情境重新组合”(π0 2024)。

〔未覆盖项〕本条的单因命题是:决定通用具身策略是否越过记忆复现的只有跨身体经验能否按语言目标组合成训练集中不存在的完整技能,而不是模型参数或轨迹总量本身。组合要求物体语义、双臂协调、接触控制、恢复和终止在长轨迹中接续;任何一段只靠相似示范检索,未见任务就会在接口处断裂(π0.5 2025)。

π0.7在2026年报告:双臂UR5e此前没有洗衣示范,却能把其他身体与任务中的拾取、展开、配对和折叠组合为洗衣流程;通用模型在多项测试中达到专用模型的成功率,有时吞吐更高,并与平均拥有375小时经验的人类遥操作员相当。这里最硬读数应是未见“身体×技能”格子的完整成功率及中途恢复次数,而非片段相似度。〔未覆盖项〕在具身智能的这一对象上,复核应把“严格留出的身体—技能交叉格中无人工复位成功数/全部预注册试验数”拆成同一分母下的主结果与失败谱,“训练数据边界、被删失败、人工复位、安全控制器贡献与长期硬件损耗未被成功视频完整披露”要单列编码,不能在汇总时并入其他项。

这些证据主要来自开发团队选择的平台、任务和视频,尚不能当成独立通用性认证。训练数据边界不完全公开时,“未见”可能仍含相似物体、动作原语或同一环境;长任务的人工复位、失败删选和安全控制器贡献也难从展示推回。模型越通用,罕见身体的错误可被跨任务权重放大,语言引导还可能把能力带出原授权范围(π0.7 2026)。

开放验收应公布按身体、场景、物体、技能四轴去重的数据说明,并预注册真正留出的组合;第三方在不同硬件上连续运行,报告成功、吞吐、碰撞、人工接管、能耗与恢复。2026年的多尺度具身记忆把任务延长到15分钟,π0.7加入可引导行为,但记忆和引导都须有撤销、权限与证据链,不能让自然语言绕过底层安全。

它与第051号第十二条“人形与现实”相接,却把问题从某种外形移到多身体组合;也与第044号第八条“预训练、涌现与「基础模型」”对撞:真正涌现必须发生在严格留出的身体—技能交叉格,并由2026年以后独立实验复现。π0.7是一条强候选证据,不是“机器人GPT时刻”的终局判决。

位置E——把多身体数据、语言目标、动作生成与长程记忆的联合分布当成组合泛化土壤 单因决定通用具身策略是否越过记忆复现的只有跨身体经验能否组合成未见完整技能 预设〔04 测量不改变被测对象〕项目方设计的留出任务与演示不会因知晓模型弱点而改变难度和选择 量纲严格留出的身体—技能交叉格中无人工复位成功数/全部预注册试验数 失效当训练集含相似动作原语或测试由开发者筛选时,模型越通用,组合涌现的归因反而越不可信 自曝未覆盖项独立核验:π0.7的UR5e洗衣与375小时操作者比较来自项目方评测,尚缺跨机构同协议复现;独立撤回检查落在未覆盖项 空栏训练数据边界、被删失败、人工复位、安全控制器贡献与长期硬件损耗未被成功视频完整披露 异名机器人学称“人形与现实”;见第051号第十二条“人形与现实”

◎ 二十年连起来看

第一幕把身体重新写进计算:形态计算说明材料可分担控制,iCub让发展过程有共享平台,KinectFusion与GelSight扩展三维和接触观测,MuJoCo与DARPA机器人挑战分别建立模拟器和完整任务压力,端到端策略与Dex-Net则把感知—动作及合成抓取数据闭合。第二幕从2017年后把现实差异变成训练对象:领域随机化、Habitat、BEHAVIOR、Isaac Gym、VLA与跨形态数据池不断扩大分布,最终把问题推向“8种身体的经验能否组合成第9种身体的新技能”。

具身不等于装上摄像头。系统必须让动作改变后续观察,并承担接触、时钟与不可逆后果。通用不等于任务数多。700项指令若共享同一拿放机制,覆盖面仍窄。模拟不等于虚假。MuJoCo 2012与Isaac Gym 2021提供可控反事实,但结论必须在实机结算。三个界限共同防止把语言流畅、数据规模或视频观感误写成身体智能。

一套可复核系统至少应交付12类证据:机器人与末端工具规格;传感采样和控制频率;坐标系、单位与动作类型;训练、验证和留出数据谱系;模拟器及系统辨识参数;语言、视觉、动作编码版本;低层控制器与安全限位;任务初态和成功判据;完整失败与人工复位;延迟、能耗和硬件磨损;至少50次连续实机运行;可重放日志。缺少其中任何一类,成功率都可能由隐藏装置或人工补足。

◎ 三个常见误解

规模可以是130,000回合、440万条轨迹、562B参数或每秒10,000帧,但每种规模都有自己的盲点:高频动作压住稀有接触,同一种Physics偏差被并行复制,语言知识掩盖低层无能,共同动作空间抹掉身体差异。应同时报告“身体×场景×技能”覆盖矩阵、失败密度和新增数据边际收益;若总量上升而严格留出格的成功不升,系统只是更熟练地重复既有身体经验。

◎ 与相邻领域的接口

第一账是完整任务成功,第二账是接触与碰撞安全,第三账是时延和控制频率,第四账是能耗与硬件损耗,第五账是人工示范、复位和接管,第六账是同场景到新场景迁移,第七账是同身体到新身体迁移,第八账是失败后的恢复。RT-2的62%、ALOHA的80%–90%或π0.7的通用表现都必须落到同一分母;不能把被剪掉的尝试、开发者救援和低层保护从能力账中删除。

◎ 争议现场

优先保存7类失败:看对却抓错;语言计划正确但身体不可达;模拟成功而实机滑落;新夹爪使归一化动作失真;动作块在扰动后继续执行;两臂分别正确却同步冲突;最终成功但中途发生危险接触。每条反例应保留传感原流、动作命令、安全否决和复位记录。它们比成功视频更能区分是KinectFusion式观测缺口、SayCan式可供性误判,还是Diffusion Policy式时钟失配。

◎ 往下五年看什么

2026–2031年应盯住五件事:跨机构预注册的未见身体—技能组合能否复现;长达15分钟任务的错误是否随时间可控;触觉、力与视觉能否在毫秒级共同进入策略;机器人数据共享能否同时处理许可、隐私和失败披露;语言引导能否在最小权限下被低层安全独立否决。若这些问题没有稳定证据,VLA会先成为强大的演示生成器,而不是可托付的开放世界行动基础设施。

◎ 可与哪些领域对撞

与第045号生成模型对撞,动作扩散把采样带入物理世界,因而每一步都多出实时性与伤害账;与第351号高性能计算对撞,Isaac Gym把训练变成GPU流水线,却不能把实机复位并行化;与第205号医学机器人等生命健康方向对撞,身体泛化必须服从临床风险、患者差异和器械监管;与第203号网络安全对撞,语言可操纵的机器人还需要指令来源、权限和紧急停止。四个接口说明具身智能不是机器人学内部的模型竞赛。

◎ 十条可做的研究命题

从iCub 2010、DARPA挑战2015到Open X 2023和π0.7 2026,主线并非“模型终于拥有身体”,而是身体差异逐步进入表示、数据、模拟、评测和治理。具身智能的最小单位不是一段视频或一次动作token,而是“观测—估计—计划—控制—接触—验证—恢复”的闭环,以及承载它的具体机器人。只有闭环在新场景、新身体和失败后仍可度量、可停止、可复现,通用性才从宣传词变成学科对象。

◎ 资料核验

  1. Pfeifer, R., & Bongard, J. (2006). How the Body Shapes the Way We Think. MIT Press.
  2. Hauser, H., Ijspeert, A. J., Füchslin, R. M., Pfeifer, R., & Maass, W. (2012). Towards a theoretical foundation for morphological computation. Biological Cybernetics, 105, 355–370. DOI: 10.1007/s00422-012-0471-0.
  3. Hauser, H., & Hughes, J. (2024). Morphological Computation—Past, Present and Future. Device.
  4. Metta, G., Natale, L., Nori, F., et al. (2010). The iCub humanoid robot. Neural Networks, 23, 1125–1134. DOI: 10.1016/j.neunet.2010.08.010.
  5. Newcombe, R. A., Izadi, S., Hilliges, O., et al. (2011). KinectFusion. ISMAR. DOI: 10.1109/ISMAR.2011.6092378.
  6. Keetha, N., Karhade, J., Jatavallabhula, K. M., et al. (2024). SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM. CVPR.
  7. Yuan, W., Dong, S., & Adelson, E. H. (2017). GelSight. Sensors, 17, 2762. DOI: 10.3390/s17122762.
  8. Luu, Q. K., Nguyen, D. Q., Nguyen, N. H., Dam, N. P., & Ho, V. A. (2025). Vision-Based Proximity and Tactile Sensing for Robot Arms. IEEE Transactions on Robotics, 41, 5000–5019. DOI: 10.1109/TRO.2025.3593087.
  9. Todorov, E., Erez, T., & Tassa, Y. (2012). MuJoCo. IROS. DOI: 10.1109/IROS.2012.6386109.
  10. Krotkov, E., Hackett, D., Jackel, L., et al. (2017). The DARPA Robotics Challenge Finals. Journal of Field Robotics, 34, 229–240. DOI: 10.1002/rob.21683.
  11. Levine, S., Finn, C., Darrell, T., & Abbeel, P. (2016). End-to-End Training of Deep Visuomotor Policies. JMLR, 17, 1–40.
  12. Mahler, J., Liang, J., Niyaz, S., et al. (2017). Dex-Net 2.0. RSS. DOI: 10.15607/RSS.2017.XIII.058.
  13. Tobin, J., Fong, R., Ray, A., et al. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IROS. arXiv:1703.06907.
  14. Dai, T., Wong, J., Jiang, Y., et al. (2024). Automated Creation of Digital Cousins for Robust Policy Learning. CoRL. arXiv:2410.07408.
  15. Savva, M., Kadian, A., Maksymets, O., et al. (2019). Habitat. ICCV. arXiv:1904.01201.
  16. Shridhar, M., Thomason, J., Gordon, D., et al. (2020). ALFRED. CVPR. arXiv:1912.01734.
  17. Kim, T., Min, C., Kim, B., et al. (2024). ReALFRED. ECCV. arXiv:2407.18550.
  18. Srivastava, S., Li, C., Lingelbach, M., et al. (2022). BEHAVIOR. CoRL, PMLR 164.
  19. Makoviychuk, V., Wawrzynski, P., Guo, Y., et al. (2021). Isaac Gym. arXiv:2108.10470.
  20. Ahn, M., Brohan, A., Brown, N., et al. (2022). Do As I Can, Not As I Say. CoRL, PMLR 205. arXiv:2204.01691.
  21. Brohan, A., Brown, N., Carbajal, J., et al. (2022). RT-1. arXiv:2212.06817.
  22. Driess, D., Xia, F., Sajjadi, M. S. M., et al. (2023). PaLM-E. ICML, PMLR 202, 8469–8488.
  23. Brohan, A., Brown, N., Carbajal, J., et al. (2023). RT-2. CoRL, PMLR 229, 2165–2183.
  24. Open X-Embodiment Collaboration. (2023). Open X-Embodiment. arXiv:2310.08864.
  25. Octo Model Team. (2024). Octo: An Open-Source Generalist Robot Policy. RSS. arXiv:2405.12213.
  26. Chi, C., Feng, S., Du, Y., et al. (2023). Diffusion Policy. RSS; IJRR.
  27. Prasad, A., Lin, K., Wu, J., Zhou, L., & Bohg, J. (2024). Consistency Policy. RSS. arXiv:2405.07503.
  28. Zhao, T. Z., Kumar, V., Levine, S., & Finn, C. (2023). Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. arXiv:2304.13705.
  29. Fu, Z., Zhao, T. Z., & Finn, C. (2024). Mobile ALOHA. arXiv:2401.02117.
  30. Black, K., Brown, N., Driess, D., et al. (2024). π0. arXiv:2410.24164.
  31. Physical Intelligence. (2025). π0.5: A Vision-Language-Action Model with Open-World Generalization. arXiv:2504.16054.
  32. Physical Intelligence. (2026). π0.7: General-Purpose, Steerable, and Compositional Robot Policies. Official research report, 16 April 2026.
  33. Physical Intelligence. (2026). Multi-Scale Embodied Memory for Long-Horizon Robot Control. Official research report.
  34. Google DeepMind. (2025). Gemini Robotics: Bringing AI into the Physical World. Official technical report.
  35. Google DeepMind. (2026). Gemini Robotics 2 and Gemini Robotics ER 2. Official model reports, 30 July 2026.
  36. NVIDIA. (2026). GR00T N1.7: An Open Foundation Model for Humanoid Robots. Official technical report.
  37. OXE-AugE Collaboration. (2025). Augmenting Open X-Embodiment for Unseen Robot Transfer. Preprint.
  38. Hansen, N., Su, H., & Wang, X. (2023). TD-MPC2: Scalable, Robust World Models for Continuous Control. arXiv:2310.16828.
  39. Nair, S., Rajeswaran, A., Kumar, V., Finn, C., & Gupta, A. (2022). R3M. CoRL, PMLR 205.
  40. Mees, O., Hermann, L., Rosete-Beas, E., & Burgard, W. (2022). CALVIN. IEEE RA-L, 7, 7327–7334.
  41. Li, C., Xia, F., Martín-Martín, R., et al. (2022). iGibson 2.0. CoRL, PMLR 164.
  42. Andrychowicz, O. M., Baker, B., Chociej, M., et al. (2020). Learning Dexterous In-Hand Manipulation. IJRR, 39, 3–20.
  43. OpenAI, Akkaya, I., Andrychowicz, M., et al. (2019). Solving Rubik's Cube with a Robot Hand. arXiv:1910.07113.
  44. Kalashnikov, D., Irpan, A., Pastor, P., et al. (2018). QT-Opt. arXiv:1806.10293.
  45. Dasari, S., Ebert, F., Tian, S., et al. (2020). RoboNet. CoRL, PMLR 100.
  46. Padalkar, A., Pooley, A., Jain, A., et al. (2023). Open X-Embodiment Dataset and RT-X. arXiv:2310.08864.