通用视觉智能体技能革命:从看懂世界到学会做事 1. 从“看”到“做”通用视觉智能体的技能革命最近在跟几个做机器人学和具身智能的朋友聊天大家普遍有个共识现在的视觉模型尤其是那些大型多模态模型越来越“能说会道”了。你给它一张图它能给你描述得天花乱坠甚至还能跟你聊上几句。但如果你让它“根据这张图把桌上的杯子拿起来”或者“看着这个乐高说明书把积木拼起来”它多半就哑火了。这背后反映的正是当前通用视觉智能体General Visual Agents面临的核心瓶颈——它们缺乏将视觉理解转化为具体、可执行动作的“技能”。这正是“MMSkills: Towards Multimodal Skills for General Visual Agents”这个研究方向试图攻克的难题。它不是一个具体的工具或产品而是一个前沿的研究框架和思想。简单来说MMSkills的核心目标是让智能体不仅“看懂”世界视觉感知还能“学会”如何在这个世界里“做事”技能执行。这里的“技能”不再是简单的图像分类或目标检测而是包含了“拿起”、“旋转”、“组装”、“按压”等一系列带有明确动作意图和物理交互逻辑的“过程性知识”。为什么这件事如此重要想象一下未来的家庭服务机器人、工业自动化质检员甚至是游戏里的NPC。它们需要的不是对场景的静态描述而是动态的、目标导向的行动能力。比如看到一个水龙头在滴水它需要知道“拧紧”这个动作需要怎样的手部轨迹、施加多大的扭矩看到一个散落的工具箱它需要理解“使用螺丝刀拧螺丝”这一系列子步骤的先后顺序和操作要点。MMSkills试图将这些离散的“技能”封装成模块化的、可组合的“技能包”让智能体能够像搭积木一样根据视觉感知到的任务目标调用并组合相应的技能来完成复杂工作。这听起来有点像给机器人写“菜谱”但远比菜谱复杂。因为现实世界充满不确定性物体的形状、光照、遮挡都在变化一个鲁棒的技能必须能适应这些变化。MMSkills的研究正是要解决如何从多模态数据视频、文本指令、动作序列、力反馈等中抽象、学习和泛化出这些技能并让智能体具备根据新场景自主规划和组合技能的能力。接下来我们就深入拆解这个框架背后的核心逻辑、技术挑战以及它可能带来的范式转变。2. “技能”究竟是什么拆解MMSkills的核心构成要素在MMSkills的语境下“技能”是一个高度结构化的概念它远不止一个动作标签。我们不能简单地说“抓取”是一个技能因为抓取一个鸡蛋和抓取一个扳手在力度、手形、接触点上截然不同。因此我们需要从多个维度来解构一个合格的“多模态技能”。2.1 技能的三层结构感知、规划与执行一个完整的技能包我认为至少包含三个紧密耦合的层次第一层感知与状态理解层。这是技能的“眼睛”和“大脑”初期。智能体需要从视觉输入中提取出与执行该技能相关的关键状态信息。例如对于“拧开瓶盖”这个技能感知层需要识别出瓶盖的类型是按压式还是旋转式、当前状态是紧闭还是已松动、瓶盖与瓶身的相对位姿甚至估计瓶盖的尺寸和纹理判断摩擦力。这通常需要结合目标检测、姿态估计、语义分割甚至是一些物理属性预测模型。MMSkills强调“多模态”意味着除了RGB图像可能还会利用深度图判断距离、触觉信号判断接触来丰富状态表征。第二层动作规划与参数化层。这是技能的“决策中枢”。基于感知到的状态这一层需要生成具体的动作序列。关键在于这个序列是“参数化”的。以“插入”技能为例它不是一个固定的轨迹而是一个由若干关键参数定义的模板动作插入(对象A 对象B 对接轴 插入深度 允许容错)。规划层需要根据当前A和B的位置、方向实时计算出最优的对接轴approach axis和插入路径。参数化使得技能具有了泛化能力同一个“插入”技能可以用于插USB线、插钥匙、插积木只要提供了正确的参数。第三层闭环控制与适应层。这是技能的“小脑”和“反射神经”。在真实物理世界中执行动作时会遇到各种预期之外的情况物体滑动、阻力突变、定位误差。纯粹的“开环”执行按预定轨迹走到底必然会失败。因此技能必须包含一个闭环反馈机制。例如在“旋拧”技能中控制层需要持续读取腕部力传感器和视觉反馈如果发现扭矩过大可能螺纹不对或打滑能实时调整握持力度或旋转速度甚至触发重试或报错。这通常需要结合基于模型的预测控制如MPC或无模型的强化学习策略。2.2 过程性知识从静态知识到动态脚本传统视觉模型学习的大多是“陈述性知识”这是一个杯子那是红色的。而MMSkills关注的是“过程性知识”如何操作这个杯子。过程性知识更像一个可执行的脚本或程序它定义了前提条件执行技能前世界必须满足的状态。例如“倒水”技能的前提条件是水壶中有水杯子的开口朝上且位于水壶下方可接水的位置。执行体动作的主体通常是机器人末端执行器或虚拟智能体的“手”需要达成的子目标序列。例如“倒水”可能包含移动至抓取点 - 抓握水壶把手 - 提起并移动至杯口上方 - 倾斜水壶至特定角度 - 保持直至水位达标 - 回正水壶 - 放回。效果技能成功执行后世界状态发生的变化。例如杯子中的水量增加水壶中的水量减少。失败模式与恢复策略什么情况下算失败如水洒出以及失败后可以尝试哪些恢复动作如调整倾斜角度、停止倾倒。MMSkills的贡献之一就是研究如何从大量的演示视频如人类操作录像、仿真动画中自动或半自动地提取出这种结构化的过程性知识并将其编码成可被智能体理解和调用的形式。2.3 技能的模块化与组合性单个技能的能力是有限的。MMSkills的宏大愿景在于技能的“组合爆炸”。通过将原子技能如抓取、放置、推、拉、旋转模块化智能体可以通过逻辑顺序或条件判断将它们组合起来完成复杂任务。例如“泡一杯茶”可以分解为序列 [ 技能(取茶杯 位置橱柜), 技能(放置 对象茶杯 目标位置桌面), 技能(打开盖子 对象茶叶罐), 技能(舀取 工具茶匙 材料茶叶 源茶叶罐 目标茶杯), 技能(倒水 容器水壶 目标茶杯 直至水位线), 技能(等待 时长3分钟), 技能(搅拌 工具茶匙 容器茶杯) ]这种组合要求技能之间有清晰、稳定的接口输入输出状态并且技能本身要足够鲁棒以避免错误在组合链中传递和放大。如何让智能体自动学习这种任务分解和技能组合策略是MMSkills框架下的高阶问题。3. 如何教会智能体一个“技能”MMSkills的关键技术路径知道了技能是什么下一个问题就是我们怎么让一个智能体学会它MMSkills作为一个研究方向融合了计算机视觉、机器人学、强化学习等多个领域的技术我将其关键技术路径归纳为以下几条。3.1 数据驱动的技能学习从演示中提炼知识这是目前最主流也最直观的方法。核心思想是“模仿学习”。我们收集大量人类或专家执行某个技能的多模态数据然后让模型去学习从观察到动作的映射。1. 行为克隆最简单直接的方式。把演示中的观察图像、状态作为输入对应的动作关节角度、电机控制指令作为标签训练一个监督学习模型如深度神经网络。这就像学生看老师做一遍然后模仿。但它的弊端很明显分布偏移。学生一旦在模仿过程中犯了个小错导致状态偏离了老师演示过的数据分布接下来就可能一步错步步错因为模型没见过这种状态会输出不可预测的动作导致彻底失败。它缺乏纠错能力。2. 逆强化学习/模仿学习更高级的方法。它不直接模仿动作而是试图理解演示数据背后隐含的“奖励函数”——即老师为什么这么做什么样的状态和动作序列是好的。学会了这个奖励函数后智能体可以通过规划如最优控制或强化学习来生成自己的动作这样在面对新状态时它可以通过最大化学到的奖励函数来找到合理的动作而不仅仅是重复旧数据。这赋予了智能体一定的泛化和适应能力。MMSkills框架中如何从多模态演示特别是视频中高效地学习奖励函数是一个关键课题。3. 关键点与程序提取对于技能学习我们不一定需要逐帧模仿每一个细微动作。很多时候抓住几个“关键帧”或“子目标”就足够了。例如“开门”技能的关键点可能是手接近门把手 - 握住把手 - 下压把手 - 拉开门。研究人员正在探索如何从视频中自动检测这些关键状态变化点并将技能抽象为一个由这些关键点构成的“程序”。这大大降低了学习难度并提高了技能的可解释性和可组合性。3.2 仿真到真实的技能迁移在数字世界中“练兵”在现实世界中收集机器人技能数据成本极高、速度极慢且存在安全风险。因此利用高保真物理仿真环境如Isaac Sim, PyBullet, MuJoCo进行技能训练再将训练好的策略迁移到真实机器人上是一条必由之路。仿真环境的构建这不仅仅是建模几何形状和重力。为了学习灵巧技能仿真需要尽可能真实地模拟接触力学、摩擦、变形、液体流动等。例如学习“揉面团”技能仿真器必须能模拟面团的粘弹性学习“插拔插头”需要模拟插头与插座之间细微的卡扣力和对齐容差。MMSkills研究中对仿真保真度提出了很高要求。域随机化这是解决“仿真到真实”鸿沟的核心技术。在仿真训练时我们主动、随机地改变一些环境参数如物体颜色、纹理、光照、摩擦系数、电机阻尼、传感器噪声等。这样训练出来的策略不会过度依赖仿真环境中某个特定的、不真实的参数而是学会了在一个“参数分布”内都鲁棒的策略。当部署到真实世界时真实环境被看作是这个广阔参数分布中的一个样本策略就有很大概率能正常工作。在环仿真更先进的思路是“在环仿真”即让仿真环境与真实数据持续交互。例如用真实机器人尝试几次动作收集数据然后用这些数据来校正仿真模型的参数如物体质量、摩擦系数让仿真环境变得更“像”真实世界然后在更新后的仿真中继续训练策略。如此循环不断缩小仿真与真实的差距。3.3 基于大模型的高层技能规划与组合近年来大型语言模型和视觉-语言模型展现出了惊人的世界知识和逻辑推理能力。MMSkills研究自然地将它们引入作为技能的“高层指挥官”。LLM作为任务规划器给定一个自然语言指令如“请帮我打扫一下房间”LLM可以将其分解为一系列原子技能序列[拿起扫帚 清扫地面 将垃圾倒入垃圾桶 放回扫帚]。LLM利用了其从海量文本中学到的常识知道打扫房间通常需要这些步骤。VLM作为状态理解与技能选择器纯文本LLM缺乏对当前具体视觉场景的理解。因此需要视觉-语言模型出场。VLM可以分析当前的场景图像理解物体的具体位姿、状态如“扫帚靠在墙角”、“地上有纸屑”然后将这些信息与LLM生成的高层计划结合实例化为具体的、可执行的技能调用。例如VLM看到扫帚的位置后会将“拿起扫帚”实例化为技能(抓取 对象扫帚 抓取点手柄)。大模型的局限与挑战大模型生成的计划常常是“纸上谈兵”。它可能不知道“扫帚太重当前机器人抓不起来”或者“垃圾桶已经满了需要先倒掉”。因此需要将技能库的“能力模型”即每个技能的前提条件和效果以结构化形式提供给大模型或者让大模型通过与仿真环境交互来验证和修正自己的计划。此外如何让大模型理解技能执行过程中的连续状态变化和物理约束仍是待解难题。4. MMSkills面临的五大核心挑战与应对思路理想很丰满但通向通用视觉技能的道路上布满荆棘。结合我过去在相关项目中的经验我认为MMSkills要落地必须正面应对以下五个核心挑战。4.1 长视野任务中的组合错误累积单个技能的成功率可能很高比如抓取成功率达99%放置成功率达98%。但当一个任务需要连续执行10个这样的技能时整体成功率就会骤降至0.99^10 ≈ 90%0.98^10 ≈ 82%。在工业场景中82%的成功率是不可接受的。更严重的是前一个技能的微小误差如放置位置偏差了2毫米可能会被后一个技能放大导致最终失败。应对思路技能设计容错性在设计技能时就考虑其输入输出的容错范围。例如“放置”技能的目标不是一个点而是一个区域插入技能允许一定的角度偏差并通过柔顺控制来自动对齐。状态验证与重试机制在每个技能执行前后加入严格的状态验证。例如执行“抓取”后用视觉或力觉验证是否真的抓稳了物体。如果验证失败不是盲目执行下一步而是触发一个“恢复技能”如调整抓握姿势、重新尝试抓取或者回退到上一步。全局重规划当错误发生时高层规划器不应死板地继续原计划而应能根据当前新的世界状态动态重新规划剩余的技能序列。这需要强大的在线重规划能力。4.2 多模态感知的融合与对齐难题技能执行依赖精准的感知。但视觉RGB-D、触觉、力觉、听觉等不同模态的数据在格式、频率、噪声特性上差异巨大。如何有效地融合它们形成对物体和环境的统一、稳定表征是一个经典难题。例如视觉告诉你物体表面是光滑的但触觉告诉你其实有细微的纹理该信谁应对思路跨模态注意力机制使用Transformer等架构让不同模态的特征在特征层面进行交互和注意力加权。在需要精确力控的阶段如插入模型可以更关注力觉信号在寻找物体的阶段则更关注视觉信号。以任务为导向的融合不是为所有任务设计一个通用的融合网络而是根据当前要执行的技能动态调整融合策略。例如“拧螺丝”技能会赋予力矩传感器信号极高的权重而“识别物体”技能则主要依赖视觉。在潜在空间进行对齐通过对比学习等方法让描述同一物理属性的不同模态特征如物体的“硬度”既可以通过视觉反光特性推测也可以通过触觉直接感知在潜在空间中彼此靠近从而建立跨模态的语义关联。4.3 技能的可泛化性与样本效率矛盾我们希望一个“抓取”技能能抓取它从未见过的物体泛化性但同时又希望只用少量数据就能学会这个技能样本效率。这两者在某种程度上是矛盾的。基于深度神经网络的方法通常需要大量数据而基于模型如物理模型的方法泛化性好但建模复杂现实困难。应对思路元学习与少样本学习让模型学会“如何学习技能”。在大量不同物体、不同场景的技能数据上做预训练使模型获得快速适应新任务的基础能力。当遇到一个新物体时只需少量演示甚至一次演示模型就能调整其内部参数学会抓取这个新物体。解耦表征学习训练模型将场景分解为与技能无关的要素如背景、光照和与技能相关的要素如物体的可抓取区域、质量分布、摩擦系数。学习技能时主要关注这些相关要素的变化规律这样更容易泛化到新物体上。利用物理先验将物理常识如重力方向、力与运动的关系、几何约束作为归纳偏置注入模型架构或损失函数中可以极大地减少模型需要从数据中学习的内容提高样本效率。例如在训练抓取预测网络时可以加入“抓取点连线应大致穿过物体重心”这样的物理约束。4.4 安全性与可靠性保障当智能体从虚拟走向现实尤其是与人类共处时安全是头等大事。一个技能执行失败最坏的情况不应该是造成设备损坏或人员伤害。应对思路安全层设计在技能执行层和控制层之上设计一个独立的安全监控层。这个层以更高的频率运行持续监测关节力矩、末端速度、与障碍物的距离等关键指标。一旦任何指标超过安全阈值立即触发停止或切换到安全的缓和动作覆盖掉技能控制器发出的指令。可中断技能设计技能本身应被设计为可在任何时刻被安全地中断和恢复。这意味着技能执行过程应保持一定的柔顺性和低惯性避免“猛冲猛停”。同时系统需要记录中断时的状态以便在安全条件恢复后能从中断点继续执行或安全地回退。仿真中的压力测试在将技能部署到真实世界前在仿真中进行极端情况下的压力测试。例如故意设置感知噪声、执行器延迟、物体位置突变等故障观察技能的执行情况并据此调整技能参数或增加安全措施。4.5 评估体系的缺失我们如何评判一个技能学得好不好目前缺乏统一、全面、公认的评估基准。准确率、成功率这些指标过于单一无法衡量技能的鲁棒性、效率、优雅程度以及对新场景的适应能力。应对思路构建标准化技能测试集类似于计算机视觉中的ImageNet需要构建一个覆盖不同难度、不同领域、不同干扰条件的技能测试环境包括仿真和真实。每个测试任务都有明确的成功标准不仅是最终状态有时还包括过程约束如不能碰到其他物体。多维度评估指标除了最终成功率还应评估技能执行时间、能耗、轨迹平滑度、对扰动的恢复能力如轻轻推一下物体技能能否继续完成、在分布外场景下的性能衰减程度等。引入人类主观评价对于一些与人类交互紧密的技能如递送物品技能的“人性化”程度很重要。这可以通过让人类用户对技能执行过程进行打分如是否感到舒适、自然、可预测来评估。5. 从研究到应用MMSkills的潜在落地场景与展望尽管挑战重重但MMSkills所代表的方向具有巨大的应用潜力。它不仅是学术前沿也正在逐步走向产业实践。5.1 工业自动化与柔性制造这是最直接的应用场景。传统的工业机器人依赖于精确的预编程和固定的工装夹具无法适应小批量、多品种的柔性生产需求。无序抓取与分拣在物流仓库中MMSkills驱动的机器人可以从杂乱的货箱中识别并抓取各种形状、尺寸、材质的商品准确放入订单箱。这需要强大的“识别-抓取规划-执行”一体化技能。装配与检测在电子产品装配线上机器人可以观看人类工人的演示视频学会如何将精密的零件如手机摄像头模组对齐、按压、扣合。同时结合视觉技能可以在装配过程中进行在线质量检测。人机协作工人和机器人共享工作空间。机器人需要具备“理解人类意图”的技能例如当工人伸出手时机器人能理解这是需要工具并将正确的工具递到工人手中当工人进行精细操作时机器人能主动避让或提供辅助照明、固定。5.2 家庭服务与个人机器人让机器人进入家庭帮助老人、残疾人或普通家庭处理日常事务是长久以来的梦想。MMSkills是让梦想照进现实的关键。厨房助手从识别冰箱里的食材到根据菜谱完成“打蛋”、“切菜”、“翻炒”、“装盘”等一系列技能。这需要处理非结构化的环境每家厨房布局都不同、易变形的物体蔬菜、面团和复杂的物理交互流体、热传导。居家整理识别散落的玩具、书籍、衣物并将其分类整理到指定位置。这需要长期的物品定位与追踪技能以及处理大量相似物体的能力。个性化看护帮助行动不便者取药、倒水、开关灯甚至在其跌倒时发出警报并尝试提供初步帮助。这对技能的可靠性和安全性要求达到了最高级别。5.3 虚拟内容创作与游戏AI在虚拟世界中MMSkills同样大有可为。自动三维动画生成给定一段文字描述如“一个角色开心地跳起来击掌”AI可以自动生成符合物理规律、动作流畅的三维角色动画。这本质上是在虚拟环境中执行一系列“运动技能”。智能游戏NPC游戏中的非玩家角色不再依赖预设的脚本而是具备基本的视觉感知和物体操作技能。它们可以真正地与游戏环境互动捡起武器、寻找掩体、操作载具、合作完成目标为玩家提供更深度的沉浸感和挑战。仿真训练数据生成利用掌握了丰富技能的虚拟智能体可以在仿真环境中自动、大规模地生成各种任务执行过程的视频数据。这些高质量、带标注的数据可以反过来用于训练更好的视觉模型和技能模型形成数据闭环。5.4 科学研究与探索在人类难以到达或危险的环境中具备高级技能的自主机器人将成为得力的助手。深海/太空探索在海底或外星表面机器人需要自主操作科学仪器、采集样本、进行简单的设备维护。通信延迟极大要求机器人必须具备高度自主的技能执行和故障处理能力。灾难救援在地震、火灾后的废墟中机器人需要识别幸存者位置并执行“移开障碍物”、“开辟生命通道”等复杂技能这对环境的非结构化和不确定性处理能力是终极考验。从我个人的观察来看MMSkills领域正处在一个从理论框架向工程实践跨越的关键节点。早期的研究更多集中在单个技能的模仿学习上而现在社区越来越关注技能的组合、长程规划、以及与现实物理世界的稳健交互。下一个突破点很可能在于如何将大语言模型的世界知识和推理能力与低层技能的精确控制和物理常识更紧密、更可靠地结合起来。同时构建大规模、高质量、多模态的技能学习数据集和基准测试平台将是推动整个领域快速发展的基础设施。这条路很长但每解决一个像“让机器人稳健地拧开一个从未见过的瓶盖”这样具体的问题我们就离真正的通用视觉智能体更近了一步。