
26年9月来自富士公司和CMU的论文“Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models”。这篇论文最有价值的贡献是把机器人学习中的环境表征、动作生成和未来预测放进同一个分析框架说明很多失败发生在三者的连接处。它提供了较清晰的研究地图但“如何统一、统一到什么程度、收益是否超过代价”仍主要停留在研究主张和定性分析层面。如图 1 所示融合感知、动作与推理的理想且鲁棒的现实世界机器人学习概览。论文的核心命题是机器人需要把“理解环境、决定动作、预测后果”组织成持续更新的闭环。作者认为当前研究大致沿三条路线发展技术方向要回答的问题主要输出单独发展时的局限表征学习环境中有什么哪些信息与任务有关场景特征、几何结构、历史记忆或状态估计视觉上有区分度的特征未必适合控制视觉—语言—动作模型VLA根据观察和指令机器人应该怎样行动单步动作、动作序列或动作分布可以模仿行为却未必可靠地预测行为后果世界模型World Model如果执行这些动作环境将怎样变化未来观测、潜在状态、奖励或物体运动预测可能看起来合理却不符合物理约束或机器人能力这里的基础问题是部分可观测性机器人通常只能看到图像、深度、触觉和自身关节状态无法直接获得完整的真实环境状态。因此论文在第 2 节引入三种相关但不同的信息交互历史 h_t过去的观察与动作。学习表征 z_t phi(h_t)对历史中有用信息的压缩。信念状态 b_t p(x_th_t)对真实状态有哪些可能性的概率描述。例如物体被机械臂遮住之后可靠系统仍需要保留“它可能在哪里、是否已经移动”的判断并让这一判断影响接下来的动作。作者所说的“统一”包括共享表征、联合训练目标、预测反馈和不确定性传递。模块化架构也可以实现统一关键在于模块之间的信息是否真正影响决策。模仿学习和强化学习则是训练范式可以用于上述不同组件并不与三条主轴处于同一分类层级。环境表征部分关注的是什么信息值得保留才能同时支持动作与预测。第 4 节第 14—18 页如图 3 所示机器人学习中环境表征的演变。论文按照从低维状态到几何与时序信息的扩展梳理了以下路线表征形式主要价值主要限制低维状态与本体感知关节位置、速度、力矩等结构清晰便于控制计算成本较低外部环境状态往往需要另外估计自身状态不能代表完整场景单视角二维图像能从原始视觉输入学习语义、物体关系和可操作性深度、遮挡和运动信息不充分容易受背景与视角影响多视角表征利用不同视角补充被遮挡信息改善空间理解增加传感器、标定、融合和计算成本三维几何表征点云、体素、隐式几何等能够明确表达空间结构高分辨率处理成本较高几何信息也不等于完整动力学时序与四维表征表达场景如何随时间变化支持运动理解和未来预测历史压缩、长期一致性和实时处理仍然困难其中涉及的代表技术包括 CNN、视觉 Transformer、PointNet、NeRF、Gaussian Splatting以及时序潜变量模型。这一部分的重点并不是“输入维度越高越好”而是表征必须保留对任务后果有影响的变量。例如抓取任务可能需要保留物体姿态、接触位置和运动趋势同时忽略无关背景纹理。一个能够重建漂亮图像的表征如果丢失了滑动、接触或遮挡物体的信息仍然可能无法支持可靠操作。VLA 部分梳理了三种把视觉与语言信息转化为机器人动作的主要组织方式。第 5 节第 18—25 页第一种是直接预测动作的端到端 VLA。论文以 RT-1、RT-2、OpenVLA 等为代表讨论如何将视觉观察、语言指令和机器人状态映射成动作。RT-2 一类方法利用视觉语言预训练获得的语义知识3D-VLA、GeoVLA、PointVLA 等进一步引入空间几何信息。这条路线的吸引力在于统一输入和输出接口。但语义理解与精确控制之间仍存在距离理解“拿起杯子”并不自动决定合适的抓取姿态、接触力和运动轨迹。数据需求、推理延迟和对具体机器人动作空间的依赖也限制了迁移能力。第二种是在多模态主干之后连接生成式动作头。主干负责理解场景和任务动作头负责产生连续控制量或动作序列。论文重点讨论两类方法扩散策略从噪声出发逐步生成符合当前观察和指令的动作序列。流匹配策略学习将噪声分布变换为动作分布的向量场在适当设计下可以减少采样计算。生成式动作预测的重要性在于处理多种有效行为。例如绕过障碍物可以从左侧或右侧进行。如果用单一回归结果拟合这两类示范可能得到穿过障碍物的平均轨迹生成式策略可以保留不同动作模式。但需要区分能生成多条可选轨迹不代表知道每条轨迹有多可靠。这也是论文后续强调动作置信度、风险评估和反馈控制的原因。第三种是分层与推理增强的 VLA。高层先生成子目标、中间状态或任务步骤低层再执行具体动作。论文讨论了 PaLM-E以及引入语言推理、空间关系图和时空表征的后续工作。这种组织方式适合长任务但有两个突出问题高层生成的步骤未必在当前物理条件下可执行高层推理较慢而底层控制需要及时响应。论文因此讨论了高层慢速更新、底层快速执行的组织方式以及执行反馈如何反过来修正计划。如图 4 所示基于视觉的机器人学习中确定性策略与生成式策略的比较。如图 5 所示基于扩散与基于流的动作生成方法的比较。世界模型部分最重要的区分是“生成符合目标的未来”与“预测具体动作的后果”。第 6 节第 25—34 页语言条件世界模型根据当前场景和任务描述生成未来。例如输入“把杯子放进盒子”输出一段完成该任务的视频或潜在轨迹。论文讨论了 RoboDreamer、DreamGen 等工作。其用途包括任务想象、子目标生成、合成数据和策略指导。但从未来视频得到机器人动作通常还需要逆动力学模型或动作解码器。视频可能符合指令却包含物体消失、刚体变形或机器人无法实现的接触过程。动作条件世界模型输入具体动作或动作序列预测环境怎样响应。它更直接地支持候选动作比较、模型预测控制、策略评估和想象空间中的强化学习。Dreamer 系列是论文讨论的典型路线。作者特别指出世界模型的价值不只在于预测图像。它也可以预测潜在状态、奖励、接触或物体运动。控制导向的模型可能不需要生成清晰视频只要保留决定任务成败的动态信息。世界—动作模型WAM尝试联合生成动作与未来状态。论文列举了联合自回归预测、动作与视频双流网络、共享潜在空间等形式并讨论 WorldVLA、LingBot-VA、MinD 等代表工作。这类方法尝试让“准备做什么”与“预期会发生什么”保持一致但仍面临动作标注数据不足、动作空间依赖机器人以及长期预测漂移等问题。世界模型作为模拟环境则是一类用途在模型内部训练或改进策略生成数据评估动作或者进行安全过滤。它可以减少真实交互成本但也产生新的风险策略可能利用模型的预测漏洞在想象中完成任务却在真实环境中失败。因此预测误差如何影响策略是这条路线的核心问题。这里还应保留一个边界动作条件预测更适合研究动作后果但仅仅输入动作并不能保证模型已经学到了可泛化的因果机制。如图 6 所示机器人学习中语言条件与动作条件世界模型的比较论文对“统一”的具体贡献主要体现在整合机制与失败诊断的对应关系。表 2、表 6第 7、35 页整合机制具体含义希望改善的能力表征—策略整合用动作需求塑造表征例如保留抓取相关几何和可操作性感知真正服务于控制表征—世界模型整合让内部状态保留可预测的动态和物体关系建立适合预测的状态抽象策略—世界模型整合利用预测结果评价、调整或优化动作提前考虑后果三者共同整合通过共享状态、信念和执行反馈更新三者形成一致的闭环决策任务与机器人形态的抽象分离任务目标和具体关节控制方式跨机器人迁移不确定性感知的整合将可靠性估计传递给策略与预测模块决定何时重规划、补充观察或保守执行这个框架使论文超出了单纯罗列模型的层面。例如机器人抓取失败可以进一步诊断为表征没有保留关键接触信息策略生成了不适合当前物体的动作世界模型低估了滑落概率系统已经发现风险但没有把风险传递给执行决策。不同原因需要不同的改进方式不能都归结为模型规模不足。论文提出的五个开放问题分别涉及可靠性、分布变化、机器人差异和时间跨度。第 3 节第 8—13 页开放问题核心含义论文强调的缺口不确定性量化系统需要知道当前判断和未来预测有多可靠不确定性估计没有充分进入动作选择、信念更新与风险控制分布外泛化在新物体、场景、指令、传感条件或动力学下继续工作视觉或语义相似不保证原有操作方式仍然有效跨机器人形态迁移同一个任务由不同结构的机器人完成任务意图与源机器人的动作空间绑定过深长上下文理解利用较早的观察和交互推断当前状态缺乏有效的长期记忆、历史压缩与隐藏状态更新长时域预测与规划预见多步动作的后果并完成长任务预测误差累积子任务之间衔接脆弱失败恢复不足其中有两组区别尤其重要。跨机器人迁移不是复制动作而是保留预期的环境变化。夹爪与灵巧手完成“打开抽屉”时动作可以完全不同。可迁移的知识更可能是目标、物体关系和交互效果而不是原始关节轨迹。长上下文理解面向过去长时域预测面向未来。前者研究“之前发生的事情现在还有什么影响”后者研究“现在的选择将怎样影响后续任务”。增加历史窗口或一次输出更长动作序列都不能单独解决这两个问题。数据与评估部分说明了三条路线为什么容易形成各自独立的研究体系。表 3第 9 页表征学习可以使用 ImageNet、COCO、Ego4D 等视觉或视频数据VLA 更依赖 Open-X Embodiment、BridgeData V2、DROID 等带动作信息的机器人数据世界模型需要能够支撑时序预测的交互轨迹。LIBERO、CALVIN、RLBench 等则承担不同类型的操作与泛化评估。这些数据在动作标签、机器人覆盖、传感方式和任务范围上不一致使“共同训练、共同评估”变得困难。论文在第 7 节提出整合效果应通过系统行为判断例如不确定性是否经过校准危险动作是否减少新物体、新动力学和新机器人上的表现是否改善遮挡后能否恢复状态能否保留延迟依赖长任务成功率、扰动恢复和约束满足情况是否改善。这是一组评估方向论文没有据此建立统一的性能排行榜。综述最值得抓住的五个要点可以概括为以下几条。把模块接口作为研究对象。任务信息、物理约束和不确定性可能在模块之间传递时丢失。让表征服务于交互后果。视觉重建质量和语义理解能力不能充分代表控制价值。区分语义泛化与物理泛化。理解新指令、识别新物体与可靠完成新接触过程是不同能力。区分多样性与可靠性。生成多种行为或未来需要进一步配合置信度、风险评估和执行反馈。用持续闭环检验统一程度。共享网络或联合输出只是实现形式最终应检查系统是否更会记忆、预测、纠错和迁移。论文据此提出的未来方向包括共享且适合控制的潜状态、物体与关系层面的抽象、概率信念更新、物理约束在持续交互中学习并避免遗忘。论文自身的问题主要集中在论证强度、分类严谨性和可操作性。“缺乏整合是核心瓶颈”的论断合理但尚未得到充分的因果验证。论文提供了大量动机和代表案例也提出了评估指标但没有系统分离整合程度、数据规模、模型容量和训练方法各自带来的收益。因此它支持“加强整合值得研究”尚不足以证明整合不足是各种失败的主要原因。更紧密的连接还可能传播错误世界模型预测错误时策略可能更坚定地执行错误动作。论文对何时需要紧耦合、何时保留独立模块更合适讨论不够深入。分类体系混合了不同维度适合作为阅读地图作为严格分类则边界不清。“端到端”描述训练或输入输出组织“生成式动作头”描述输出机制“分层”描述决策结构一个系统可以同时具有这三种属性。世界模型分类也有类似问题“语言条件”和“动作条件”描述条件输入“WAM”描述联合建模“模拟引擎”描述用途。这些类别会重叠。此外表征部分把 RGB 视频称为“3D Temporal”容易让读者混淆二维图像加时间与显式三维几何。若将输入模态、几何结构、记忆机制和训练方式分开比较分类会更精确。文献选择和趋势统计的可复现性有限。作者在第 4 页明确说明这是代表性而非穷尽性综述并交代了检索渠道、关键词和大致年份范围。这是合理的范围声明。但论文没有完整报告检索式、精确截止日期、筛选数量和逐项编码规则。尤其图 7 使用论文数量展示趋势却缺少足够明确的统计样本与归类细节。因此该图适合说明作者观察到的趋势不宜当作严格的领域计量结果。诊断实验能够展示失败但不足以证明失败的机制或普遍性。第 33 页图 8 使用在 CALVIN 上微调的 Stable Video Diffusion 世界模型展示遮挡物体未被保留以及新动作条件下机械臂穿过桌面的现象。作者也明确承认这只是小规模诊断实验。论文没有给出充分的测试数量、失败率、重复实验、模型对照及记忆或物理约束的消融。因此不能仅凭这些例子确定问题来自“缺少因果理解”还是来自数据覆盖、输入历史、训练方式或模型容量。遮挡例子还有一个关键条件需要澄清如果模型从未观察过隐藏物体也没有其他线索就不能要求它准确恢复唯一真值此时更合理的检验是它能否表达不确定性、利用历史或主动获取信息。不确定性相关的概念和表格归类不够一致。正文后半部正确指出生成式动作的多样性不能替代可靠性估计。但前面的部分描述又较直接地把扩散、流模型或更丰富的表征与“不确定性处理”联系起来容易弱化以下区别多峰行为分布、传感噪声、模型知识不足以及置信度是否校准。表 7 也存在对应不足正文第 24—25 页已经讨论 VLA 的不确定性估计和干预机制但表中 VLA 的不确定性栏目仍全部为空。虽然表注明确表示空白不等于文献不存在这种选择仍会影响读者对研究分布的判断。流匹配的效率优势被表述得过于一般化。第 22 页将流匹配描述为沿直线路径变换分布并强调常可单步生成。这里需要区分训练中构造的条件路径、学习后的采样轨迹以及实际采用的数值求解步数。流匹配并不天然意味着单步推理。原始流匹配论文仍通过 ODE 求解器采样论文引用的代表性 VLA 模型 pi_0其实使用了10 步积分。更准确的表述应是流匹配在特定路径、训练和采样设置下可以提高效率实际优势需要比较采样步数、延迟和任务成功率。第 26 页的“通用世界模型训练目标”不够严谨不能直接当作实现公式。该公式将 KL 项写为模型潜在转移与“真实潜在转移”之间的差异并称后者来自示范。但在一般部分可观测、潜变量学习场景中示范并不会直接提供这个真实潜在转移分布。以 Dreamer 的重建目标为例KL 正则约束的是结合当前观测得到的潜在状态后验与根据过去状态和动作得到的预测先验。这与对齐一个已知的真实潜在转移不同。此外扩散、流匹配和无重建预测模型也不能直接由该公式统一概括。从框架到实际系统设计还缺少足够明确的取舍依据。论文已经讨论实时性、校准、物理约束和持续学习但尚未充分回答共享哪些状态、哪些模块联合训练、预测多远、多久重规划以及计算预算有限时应该优先保留什么能力。其代表案例也主要集中在视觉驱动的操作任务。导航、腿足运动、高频力控、触觉主导操作和长期人机交互尚未获得同等深入的综合分析。因此使用这篇综述指导具体系统时还需要补充对应任务的控制要求、数据条件与部署评估。