机器人基础模型中的具身差距 26年8月来自日本国家高级工业科学技术研究院AIST的论文“The Embodiment Gap in Robot Foundation Models”。这篇综述的核心观点是评价机器人基础模型的跨机器人能力既要看任务成功率也要看为了获得这个成功率在目标机器人上投入了多少适配工作。 模型能够复用知识、表征或动作并不意味着换一台机器人就能直接、稳定地运行。论文把“具身差距”定义为跨机器人复用的模型、表征或数据转化为符合目标机器人身体与控制系统的可执行动作时仍然存在的差距。 这里的“身体”不只是机械臂外形还涉及关节结构、末端执行器、传感器配置和控制响应。第 2 节第 2—3 页如图 1 所示例如把“拿起杯子”的策略从机器人 A 迁移到机器人 B“杯子是什么、应该拿起来”的语义可能可以复用。杯子的抓取位置可能仍然识别正确。但 B 的臂长、夹爪宽度和可达空间不同需要改变接近与抓取方式。即使末端轨迹一致控制频率、夹爪材料与力响应不同也可能导致滑落。滑落后能否察觉、停止、重新抓取又需要额外能力。论文关注的就是从可共享知识到实际执行之间这些容易被隐藏的工作。作者也限定了概念边界同一机器人上的光照变化主要属于领域偏移学习新流程主要属于任务适应同一身体从仿真迁移到现实主要属于 sim-to-real。只有这些变化与跨身体部署联系起来时才进入本文讨论的具身差距。综述主要围绕机器人操作任务尤其是 VLA 与通用操作策略展开。全文的组织工具是一张二维地图一个维度看“共享了什么”另一个维度看“目标机器人上还需要做什么”。 这是论文区别于按模型架构罗列文献的主要特点。图 2所示第 5 页横轴按照作者所理解的“距离物理执行的远近”划分五类共享结构纵轴划分四类剩余工作这张地图旨在帮助读者定位问题。作者明确说明它不测量适配工作量也不用于给方法排名。 一个方法位于更接近执行的位置不能据此认定它更先进或部署成本更低。作者据此把文献组织为三个相互重叠的研究方向。如图 3 所示第一条路线是共享语义与感知利用互联网知识扩大机器人“理解什么、关注哪里”的能力。第 4 节第 7—8 页这里包括三个逐渐接近动作的层次任务规划与技能选择。 SayCan 等方法利用语言模型分解任务、选择技能但目标机器人必须已经具备可以调用的执行能力。空间感知与可供性。 CLIPort、PerAct、RoboPoint、VoxPoser 等方法提供物体、空间位置或操作线索但位置正确不代表当前身体能够到达并稳定操作。视频与世界模型。 视频预测、VPP、FlowDreamer以及后文讨论的 Cosmos Policy、DreamZero把共享信息扩展到物体和场景的时间变化。不过预测的变化仍然需要通过目标机器人的运动与闭环控制实现。这条路线的优势是可以利用丰富的语言、图像和视频资源。其主要局限是理解任务、预测变化与实现物理变化之间仍然需要连接。 对接触密集任务而言视觉上合理的轨迹也可能产生错误的接触时机或作用力。第二条路线是共享机器人数据与接口让昂贵的物理经验更容易积累、混合训练和复用。第 5 节第 8—10 页论文把这一方向分成几类工作这一部分反复强调一个关键区别“能够放进同一个数据集”与“能够在另一台机器人上产生相同物理效果”是两个需要分别验证的问题。例如相同的末端位移指令在不同控制器上可能对应不同速度、延迟或接触压力。统一软件接口能够减少接入工作但不能自动完成这种物理对齐。第三条路线是学习跨具身对应关系直接学习不同身体之间哪些行为可以对应以及应该怎样转换。 这是论文认为最直接面向身体差异的一条路线。第 6 节第 10—11 页这里最值得注意的是两点。一是共享物体变化可以绕开部分关节差异但实现这种变化的接触方式仍然依赖身体。 同样是把抽屉拉开不同夹爪可能需要不同的接触点、姿态和施力策略。二是增加触觉和力觉既提供了解决问题的信息也引入新的适配任务。 不同机器人上的相同触觉数值未必代表相同接触状态。因此“多模态输入更多”本身也不能保证跨身体泛化。论文最具实践价值的贡献是要求把成功率背后的适配过程公开出来。 作者提出“报告卡具身适配曲线失败归因”三个互补工具。第 7 节第 12—16 页报告卡包含 11 项信息可归纳为特别需要区分的是用于调优的试验与用于报告最终性能的评测应分别记录。 如果同一批试验既用于修改系统又用于报告成功率读者就难以判断其泛化能力。作者把报告卡应用到 9 个方法组后发现其中 7 组的安全、干预和恢复次数无法从正文或公开补充材料中辨认3 组的设置或标定条件缺乏足够细节。这里的 N/R 表示“公开材料中未能识别”并不表示相关工作没有发生。具身适配曲线即 EACEmbodiment Adaptation Curve则把“适配投入—性能”关系画出来横轴选择一种可比较的投入如目标机器人示范数或真机适配试验数。纵轴记录任务成功率等性能。比较少量投入时的效果、继续投入后的改善以及是否出现平台期。如图 4 所示使用 MOTIF 的多个示范数量结果展示曲线又用 Track2Act 的开环执行与残差策略结果展示端点比较。作者明确承认Track2Act 的两个端点不能重建完整适配曲线。失败归因分为四组语义与感知、机器人数据与接口、跨具身对应、目标机器人执行。例如物体轨迹预测正确但夹爪滑落主要归于执行失败交互点超出可达范围则主要归于对应关系失败。作者允许同时记录主要与次要原因。论文提出的未来方向是让模型与系统逐步承担目前由研究者和集成工程师完成的适配工作。第 8 节第 16—17 页具体有四项1 把数据从成功轨迹扩展到适配过程。 保留标定修改、失败、接触纠偏和恢复记录。2 让通用策略与控制系统共同适应目标机器人。 系统应能识别哪里不匹配并辅助完成调整。3 学习可跨身体共享的接触表示。 将视觉、触觉、力觉、声音和接触变化结合起来同时处理传感器配置差异。4 把达到成功所需的工作纳入评测。 同时报告性能、数据、标定、运行、干预与恢复投入。这篇综述的要点可以提炼为以下五条1 泛化的实际价值包含适配效率。 最终成功率相同的系统可能有完全不同的部署代价。2 共享结构的抽象层次决定了哪些问题仍由执行系统承担。 语义更容易复用但具体动作仍需落实接近动作的表示则更受身体和控制条件影响。3 统一数据与接口只解决部分问题。 动作的物理含义需要在目标机器人上重新验证。4 运动学、接触和恢复应分别评估。 知道关节结构不能替代稳定施力与失败恢复。5 失败和调试过程本身可能成为学习资源。 这使研究目标从复现成功动作扩展到学习如何获得可靠执行。综述本身的部署视角很有价值但概念、分类和证据仍有以下问题。1 “具身差距”覆盖面较广但还不是严格可测量的概念。论文把控制对齐、接触、安全和部分系统集成都纳入其中却没有给出统一的距离或成本定义。同一问题可能由身体、任务、场景、控制器及操作人员共同造成仅凭“换机器人后需要额外工作”难以分离身体变化的独立影响。更严格的研究需要控制任务与环境分别改变身体、传感器或控制系统。还应区分目标身体本来就无法完成任务还是模型尚未学会利用它的能力。这两种情况需要不同解决方案。2 二维地图易于理解但分类稳定性有限轴上的顺序也不完全统一。横轴混合了语义层次、表示对象和模型条件“动作技能”可以同时具有“形态感知”因此它们并非天然互斥或严格递进。作者对 21 个方法组进行三人独立编码横轴 Fleiss’ κ 为 0.78纵轴仅 0.33两项坐标都获得三人一致意见的只有 7/21。作者公开这些结果值得肯定但也说明“剩余工作发生在哪里”仍高度依赖判断。第 5—6 页、附录 C具体而言分类规则说若仍需目标机器人专用策略或额外训练优先归入“控制接口对齐”但 Track2Act 使用目标机器人数据训练残差策略却被归入“接触力执行”。原论文确实报告了约 400 条身体专用示范。这里需要进一步解释分类是在适配前还是适配后观察系统。见 Track2Act 原论文。3 把多个系统合并成一个方法组会掩盖影响分类的重要差异。例如RT-2 与 PaLM-E 被共同放入“语义任务—技能连接”但 RT-2 明确把机器人动作编码成 token并学习从观测直接生成动作。把它主要表述为等待连接到技能的语义系统容易弱化其动作生成设计。见 RT-2 原论文。类似地数据集、数据格式、工具库和策略模型被放在同一张地图里有助于展示系统全貌却降低了方法之间的可比性。作者也承认数据基础设施被放入“动作技能”属于缺少专门类别时的强制选择。4 “安全恢复”一行为空不能直接证明整个领域缺少相关研究或能力。这一结果来自所选的 21 个方法组而且每个方法只能选择一个主要剩余阶段。若方法先被归入控制对齐或接触执行其安全问题就不会单独显示。因此空白也可能受到文献选择与单标签规则影响。同理7/9 个方法组没有可识别的干预统计支持的是“报告不充分”。它不能证明这些系统不安全、没有恢复能力或成功主要依赖人工。更稳妥的做法是分别标注每个阶段是否涉及、是否解决、证据是否充分。5 EAC 有用但目前主要展示数据效率尚不足以衡量完整部署成本。示范数量不能覆盖工程工时、标定次数、计算资源、设备占用和运行风险。一次性适配成本与每次任务都需要的人工重置也应分开。两条曲线即使横轴都写“示范数”若其他投入不同也不能直接判定谁更易部署。原始实验还有一个重要限定综述引用的 MOTIF 曲线来自仿真中的交错任务配置各机器人在部分任务上已有充分示范在其余任务上才使用少样本。因此它反映的是目标“机器人—任务组合”的少样本表现不能直接解释为完全未见身体从接入到部署的成本。见 MOTIF 的实验设置与表 3。6 失败分类提供了记录语言但还没有提供可靠的因果诊断方法。例如夹爪滑落看起来属于接触执行问题根因却可能是视觉误差、控制延迟、摩擦变化或抓取策略不当。记录主要与次要原因有帮助但论文没有给出如何通过日志、干预实验或模块替换确认原因的规则。附录表 10 还把“计划正确但没有可用技能”主要归入语义与感知。这也暴露出一个问题故障发生的位置与导致故障的原因在分类中尚未充分分开。7 文献覆盖适合提出问题但不足以支持全面的领域判断。作者明确将其定位为范围综述提供了纳入条件和版本核对日期不过没有完整给出可复现的检索式、筛选数量与排除清单。因此它更适合呈现代表性路线不能据此判断整个领域各种问题的发生比例。此外论证主要围绕操作、抓取和接触展开。对移动、导航、全身控制和长期自主运行其分类是否同样适用仍需专门验证。8 论文提出了值得研究的方向但尚未验证这些方向能减少多少具身差距。收集适配与恢复数据、学习共享接触表示、让上层智能体辅助部署都是合理设想。然而论文没有通过受控实验说明增加哪类数据、改变哪种系统设计能减少多少适配工时、干预次数或失败率。因此本文提供的是一个研究与报告框架。要把它发展成可检验的方法还需要在相同任务、相同适配预算和明确的身体差异下比较性能、部署投入与持续运行能力。