VLA-Precision——用于在线RL的VLA非对称协同自举方法:以人工纠偏行为克隆提速、渐进价值校准稳策、相对优势更新防漂移 前言我司七月具身在通过真机RL挑战电源精细插拔100%成功率的路上于26年9月2日的第五轮终于迎来里程碑的突破不断变换插座位置连续8次 插入成功影响插拔100%成功率的因素太多了特别是数据质量 包括sft和rollout数据质量其次算法实现 光线的影响 必要的工程优化此外即便在办公室达到了100%不代表在产线上依然能达到100%(产线上得做更多努力)我司长期投入/优化不断提升的场景包括上下料、质检、搬运、分拣、插拔、装配既然未来2-3年内具身模型通用不了(当然 说给投资人 则是另一码事)那不如先在垂直场景里做到垂直下的智能/泛化如果足够敢挑战 足够敢努力欢迎加入我们持续长期做『利于生产力且足够有价值』的事情把“改变世界”落实成实际行动有意加入者 敬请私我未来许多年皆长期有效正因为我司长期关注插拔装配故也关注到了本文要介绍的VLA-Precision第一部分 VLA-Precision: Asymmetric Co-Bootstrapping for EfficientReal-World Online RL of Vision-Language-Action Models1.1 引言与相关工作1.1.1 引言如原论文所述行为克隆Behavior CloningBC通过学习示例中密集标注的动作标签直接获取任务行为但一旦偏离示例分布误差会逐步累积且其性能始终受限于示例数据的质量相比之下强化学习ReinforcementLearningRL利用时间信用分配temporal creditassignment通过交互来学习长期动作价值因此将 RL 应用于 VLA 的后训练阶段可以通过交互产生的回报信号持续优化策略从而减轻误差累积问题并突破由示例数据所施加的性能上限为实现这一目标现有工作已经探索了基于仿真和真实世界强化学习RL的 VLA 后训练方法[4]–[6]基于仿真的 RL 支持大规模并行且对失败具有容忍度的交互在不受真实机器人物理约束的前提下实现可扩展、低成本的策略优化然而视觉观测与接触动力学上的“仿真到现实”sim-to-real差距限制了策略向物理机器人的可靠迁移[7][8]相比之下真实世界 RL 通过与物理环境的直接交互对 VLA 进行优化使策略能够适应真实世界的动力学特性及传感器噪声现有真实世界 RL 方法按模型规模大致可分为两类面向大规模预训练 VLA 的 RL 方法[9]–[11]以及面向紧凑型机器人策略的 RL 方法[12]–[14]尽管取得了上述进展真实世界的 VLA-RL 仍然受到两个关键瓶颈的制约算法稳定性不可靠的价值估计可能导致策略漂移系统效率大规模 VLA 带来的计算开销限制了训练吞吐量降低了整体在线 RL 效率具体而言为缓解算法层面的瓶颈现有方法[14]–[16]通过引入基于示范或干预的行为克隆behavioral cloning约束来正则化 RL 更新。虽然这些约束能够保持既有行为并稳定探索过程但对价值估计的改善有限。因此RL 更新仍然容易受到价值估计误差和策略漂移的影响针对系统层面的瓶颈现有方法[12][14][15]依赖于高度依赖重放的优化过程其在大规模 VLA 场景下的计算成本会显著增加从而限制训练吞吐量真实世界的在线交互则进一步放大了这一计算负担上述限制突显出要在真实世界中对大规模 VLA 进行后训练亟需更加可靠的RL 算法以及更高效的训练系统对此来自1中国科学技术大学 2精密与智能化学国家重点实验室、3北京航空航天大学、4中关村学院、5合肥斯平科技术公司的研究者提出了VLA-Precision其paper地址为VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models其项目地址为vla-precision.github.io其github地址为github.com/scy-v/VLA-Precision具体而言为了解决第一个算法层面的问题作者提出了非对称协同自举Asymmetric Co-BootstrappingACoB这是一种面向真实世界的在线RL算法将快速的行为学习与跨时间尺度的渐进式价值校准相结合在较快的时间尺度上基于干预引导的行为学习能够快速吸收成功的、由人类执行的动作加速策略改进的同时持续提升在线交互体验的质量与此同时随着自主交互经验的不断累积整体回报传播与局部偏好排序持续校准价值估计。由此得到的相对动作优势用于指导基于参考正则化的策略改进在保留已学到任务特定能力的前提下抑制策略漂移这种非对称的交互机制在不同时间尺度上形成了一个协同自举闭环快速的行为学习持续改进支撑价值估计的经验而日益可靠的价值估计则在超出直接监督范围之外引导策略更新为了解决第二个系统层面的问题作者提出了 ACoB-Stream这是一种用于真实世界大规模 VLA 在线强化学习的闭环“经验–策略”架构。在不变状态解耦和按需流式传输的指导下ACoB-Stream 在四个阶段中联合管理经验上下文状态和策略状态的生命周期经验上下文生成通过在多次更新之间保留冻结的 VLM 上下文减少策略更新过程中的冗余计算经验上下文持久化通过上下文去重和滑动窗口采样降低存储冗余并在经验不断累积时限制随机访问开销经验上下文访问通过与目标对齐的上下文检索在优化过程中提升数据访问效率策略状态同步通过可训练子空间的策略发布降低同步开销并加速策略部署这四个阶段共同构成一个闭环的“经验–策略”流在受限算力和内存条件下降低真实世界在线强化学习的端到端系统开销1.1.2 相关工作首先对于基于仿真的RL用于 VLA 训练后阶段RL有望在视觉–语言–动作任务中突破由示范学习所施加的性能上限VLA模型通过奖励驱动的探索和时间维度的信用分配来进行训练基于仿真的强化学习RL通过大规模并行交互在无需真实机器人训练成本和安全风险的前提下实现高效、高吞吐量的 VLA 探索 [17]–[19]在最早的一些研究中RIPT-VLA[20] 将动态 rollout 采样与 leave-one-out优势估计相结合从而将一次性成功率从4 % 提升至97 %而VLA-RL [7] 将轨迹级RL 与过程奖励相结合使性能比微调高出4.5 个百分点一个受控的VLA 基准测试[21] 表明RL 主要增强语义泛化和执行鲁棒性后续工作拓展了任务和策略的覆盖范围SimpleVLA-RL [22] 结合VLA 特定采样与并行渲染将LIBERO-Long [23] 从17.1 % 提升至91.7 %而RLinf-VLA [8] 协调异构工作负载实现最高2.27× 的加速对于基于流的策略πRL [24] 构造可处理的似然函数将成功率最高提高31.0 %最新工作则以物理迁移为目标RL-Co [16] 使用真实示例对基于仿真的RL 进行正则化使真实环境中的成功率分别提高24 % 和20 %而WoVR [25] 通过控制想象中的动力学来提升跨机器人平台的成功率尽管这些方法减少了真实数据需求但仿真到现实的差距仍然限制了迁移的可靠性。真实世界中的RL 将自主试错建立在真实观测和动力学之上将预训练的VLA 能力转化为精确、可靠的执行。这个优势促使作者将重点放在真实世界VLA 后训练上其次对于面向 VLA 后训练的真实世界RL通过从物理交互中学习真实世界的RL 将策略适配到实际传感与动力学从而提高在部署条件下的可靠性。用于紧凑机器人策略的RL 推动了高接触和动态操作的发展[26]-[30]HIL-SERL[12] 通过基于干预引导的在线RL在1-2.5 小时内达到近乎完美的成功率但在任务内泛化方面有限ConRFT[14] 通过在Octo 表示[31] 上进行离线到在线RL在45-90 分钟内达到96.3 % 的平均成功率但Q 最大化会牺牲先验性能并导致策略漂移Robo-Dopamine[32] 为ConRFT 配备了一个基于进展的大型奖励模型但分布外幻觉可能会误导优化RL-100[13] 将离线到在线RL 应用于扩散策略但收敛缓慢每个任务平均需要12.1 小时的真实机器人回合其中6.8 小时为离线5.3 小时为在线这些权衡促使人们研究用于大规模预训练VLA 的RL它们保留了更广泛的动作先验。π∗0.6[9]通过批量价值标注和优势条件再训练在大多数任务上成功率超过90 %但平均每个任务需要超过1,000 次真实机器人回合严重限制了反馈效率RL Token[11] 将关键阶段的吞吐量加速至多3×但每个任务需要400-1,000 个在线episode而外部化的改进和策略接力限制了端到端的适应能力不同于以往方法ACoB 建立在大规模预训练VLA 之上将快速行为学习与渐进式价值校准相结合以抑制策略漂移并开发了ACoB-Stream 以构建高效的真实世界连续在线RL 闭环最后对于面向 VLA 模型的高效在线RL系统高效的在线强化学习必须缩短闭环的“经验–策略”循环基于仿真的 VLA-RL 系统会对多模态解码进行批处理、并行化渲染并且协调异构工作负载从而实现最高达 2.27× 的加速[7], [8],[22]然而大规模并行且快速的可重置模拟器无法直接迁移到真实世界的在线强化学习对于紧凑型策略异步 actor–learner 系统通过将物理交互与重放优化重叠来提高吞吐量[12]、[33]、[14]然而这种效率并不能扩展到大规模预训练 VLA因为大规模优化会带来更高的计算、状态管理以及同步成本EXPO-FT[10] 和 RL Token[11] 分别通过优化残差动作编辑以及轻量级token 条件策略来避免将强化学习梯度反向传播穿过 VLA——这样一来基于奖励驱动的改进被限制在辅助策略上需要单独的编辑器或切换逻辑且在任务规模扩展时无法将这些改进累积到统一的策略中SOP[34] 和 USER[35] 分别通过机器人车队编排以及异构云–边缘基础设施将真实世界在线学习扩展到更大规模此类横向扩展在增加机器人和加速器数量以提升吞吐量的同时并未减少每次更新中大VLA 的计算开销有别于上述方法作者提出ACoB-Stream这是一种围绕状态生命周期组织的闭环“经验–策略”架构以不变状态解耦和按需流式传输为核心设计原则从而支持对大规模 VLA 在真实世界中进行高效、连续的在线强化学习1.2 VLA-Precision的完整方法论ACoB、ACoB-Stream如原论文所述作者首先将现实世界中大型 VLA 在异步actor–learner 流程下的强化学习后训练形式化为一个闭环的“经验–策略”优化问题随后提出非对称协同自举Asymmetric Co-BootstrappingACoB算法在抑制由价值估计引起的策略漂移的同时使策略性能突破基于示范的上限接着再提出 ACoB-Stream通过经验上下文的构建、持久化、访问以及策略–状态同步为大型 VLA 建立一个闭环的“经验–策略”流最后作者给出用于持续现实世界大规模 VLA 强化学习后训练的端到端在线训练与部署协议1.2.0 VLA 精度问题形式化在真实世界的在线RL中使用示范进行初始化可以提供与任务相关的先验从而减轻早期探索的负担并提高样本效率[12][14]对于一个大规模的预训练 VLA初始化还必须在保持预训练操作先验和任务内泛化能力的同时建立面向当前任务的专门能力为此图1 给出了VLA-Precision 框架的概览而图2 详细展示了两阶段后训练流水线阶段I 在任务示范上执行全参数模仿学习以获得任务特定的策略先验随后阶段II 从初始化真实世界的在线RL并在该异步执行者-学习者系统中改进行为专家作者将阶段II 表述为一个闭环的经验-策略优化问题具体而言作者将在任务指令 ℓ 下的物理交互建模为一个标准的马尔可夫决策过程MDP这里S 和A 表示状态空间和动作空间P 表示环境转移概率r 表示奖励函数表示初始状态分布表示折扣因子在决策步状态由视觉观测、机器人状态和任务指令组成一个VLA策略动作是一个H 步动作块其中H 是块的时域长度d 是单步动作维度执行该动作块会引起并产生累积回报其中是原始步的折扣因子任务条件策略将每个状态映射为一个动作块分布并在下诱导轨迹为了实例化任务条件策略π作者从任务微调后的π0.5 初始化在线策略并仅优化动作专家中的LoRA 参数[36]在这种参数化下表示冻结的多模态前缀参数表示从阶段I 继承的冻结动作专家参数表示动作专家中可训练的LoRA 参数动作片段生成可简洁地写为在这里是根据视觉观测、任务指令和机器人状态编码得到的任务条件多模态前缀上下文。是初始高斯噪声是单位协方差矩阵是基于流的动作专家相应的在线RL 目标为这里表示回报最大化的参数T 是以动作块决策步数衡量的序列长度为了通过持续的真实世界交互来上述求解式(3)VLA-Precision 构建了如图 2 所示的闭环求解过程(定义为公式4)在此n 表示在线更新周期和分别表示学习器进程中的可训练动作专家状态及其在执行器进程中的部署对应项而,和分别表示真实环境轨迹、在线经验池和训练批次在线经验池由重放缓冲区R、修正缓冲区C 和上下文缓冲区K 组成执行器在下生成将所有转移存储到R 中将有效修正存储到C 中并将多模态前缀上下文存储到K 中学习器使用ACoB 在上优化θn得到并作为进行部署在这一形式化中ACoB 在学习器进程内优化动作专家而ACoB-Stream 则闭合了两个进程之间的经验的策略循环1.2.1 面向动作专家的非对称协同自举渐进式价值校准、相对优势策略改进要在真实世界中可靠地对大型 VLA 进行强化学习后训练必须在防止不可靠的价值估计导致策略漂移的同时使动作专家的能力超越基于示范的性能上限为此ACoB 在式 (4)的学习器过程中建立了非对称的协同自举机制行为学习能够快速提升动作专家的能力并持续提高在线经验的质量与此同时评论家critic会在在线经验不断累积的过程中持续校准价值估计从而产生越来越可靠的相对动作优势用于进一步提升动作专家的能力ps以上这两点 在所有RL微调VLA的范式中基本都如此1.2.2 ACoB-Stream 架构首先针对渐进式价值校准可靠的价值学习既需要长时域回报估计也需要细粒度的信用分配。前者用于刻画行为在时间维度上的累积后果而后者则有助于更精确地提升策略因此ACoB 通过全局回报传播和局部偏好排序为行动专家优化建立了渐进式价值校准为了联合学习这两种信号ACoB 将价值模型实例化为由K 个任务特定的评论家组成的集成。每个评论家采用价值-优势分解其中是状态的视觉-本体感受组件是对应的目标评论家对于任意动作块令表示其OpenPI 归一化的模型表示为其展平后的评论家表示其中排除不激活的动作维度第一对于全局回报传播基于上述评论器的形式化ACoB 通过时序差分优化来传播长时间跨度的回报。令表示最终由机器人执行的动作片段它可以来自自主策略推断或人类纠正它引起如下转移其中且是终止标志。令表示可用于价值学习的样本。令表示在归一化的OpenPI动作空间中的动作专家输出对于每个采样的转移在处的自举动作及其TD 目标被构造为全局回报传播通过如下定义的集成 TD 目标来实现其中sg 表示stop-gradient。通过递归自举该目标沿已执行轨迹传播长时程回报第二对于局部偏好排序尽管纠正可以将一次rollout 修复为成功但在已执行轨迹上进行的TD 无法修正被覆盖提案的价值。因此该提案可能仍然被高估并误导动作-专家优化ACoB 通过状态匹配的局部偏好排序来解决这一限制强制将纠正置于原始提案之上在干预之前部署的VLA给出提案一次有效的干预由标记并提供一个纠正片段从而得到其中表示自主执行Exec 表示环境端动作解析。在干预下原始提案会被保留用于排序。仅在且时令否则令其中是一个很小的容差因为没有对于已观测到的后继状态作者将其从TD学习中排除只在状态匹配的排序目标中使用其中是排序边界且综合来看全局回报传播和局部偏好排序共同定义了ACoB 评论者目标其中平衡这两个信号TD 将评论者锚定在长时域回报上而局部排序则直接校准修正方案与原始方案之间的相对价值解决长时域TD 传播无法处理的局部信用分配模糊问题在分解Q V A, V 下V 表示跨动作共享的仅与状态相关的部分而排序损失只作用在A上这样将与动作相关的差异从仅与状态相关的部分中分离出来并使信号与动作层面的专家优化保持一致其次对于相对优势策略改进// 待更