具身智能或进入token时代,清华团队提出Harness VLA引领范式变迁

发布时间:2026/7/23 0:41:34
具身智能或进入token时代,清华团队提出Harness VLA引领范式变迁 清华大学于超教授团队联合正行创新、无问芯穹提出的 Harness VLA首次将 Harness Layer 引入具身智能。今天清华大学于超教授团队联合正行创新、无问芯穹正式发布并开源 Harness VLA这一技术成果首次将数字智能中广泛应用的 Harness Layer 引入具身智能系统在保持 VLA 模型冻结的基础上通过 Agentic Planner 对模型调用、任务执行和失败恢复进行统一组织让机器人从「依赖单一端到端模型」迈向「模型能力与系统能力协同工作」的新架构显著提升机器人在复杂真实环境中的泛化能力。在更具挑战性的 LIBERO-Pro 扰动评测中Harness VLA 将成功率提升至 82.4%显著超过 Pi_RLinf50%、NVIDIA Cap-X18.2%和 Berkeley RATS43.8%验证了「模型 系统」的新一代机器人智能架构的可行性。更重要的是Harness 并非针对某一特定模型设计而是一种面向系统层的通用框架。除了 VLA它同样能够与 WAM 等具身基础模型结合通过统一的任务执行层释放不同基础模型的能力为未来具身智能系统提供更加通用的组织方式。HarnessVLA 系统亮点介绍过去两年Vision-Language-ActionVLA模型几乎已经把机器人操作的标准 Benchmark 的成功率做到了接近饱和。例如在 LIBERO 130 个任务中训练的 Pi 0.5 模型平均成功率高达 96%。从抓取、搬运到整理物体大多数任务已经能够稳定完成。但这些漂亮的数字并没有真正回答一个更现实的问题机器人离开标准测试环境之后还能正常工作吗当把同样的模型部署在有目标重绑定与布局扰动的 LIBERO Pro 环境中96% 成功率锐降至 50%。尽管动作依然流畅局部操作本身也没有明显错误但由于目标绑定、空间关系或任务阶段判断出现偏差最终整个任务仍然会失败。这也是当前 VLA 最核心的挑战之一泛化能力不足。模型能够完成训练过的任务却很难稳定适应真实环境中的细微变化。面对这一问题一个自然的思路是继续扩大模型规模、收集更多数据希望模型本身能够学习到更强的泛化能力。但数字智能的发展提供了一个值得借鉴的答案。以 Claude Code、Codex 等 Coding Agent 为代表的新一代 AI 系统能力提升并不仅仅来自更大的语言模型更来自模型之外新增的一层执行组织系统Harness Layer。语言模型负责生成而 Harness 持续维护上下文、调用工具、处理失败并决定模型在什么时候、以什么方式参与任务。越来越多的研究开始意识到系统能力不仅取决于模型本身也取决于模型如何被组织和调用。那么对于机器人而言VLA 是否也需要属于自己的 Harness Layer清华大学于超教授团队联合正行创新、无问芯穹提出的 Harness VLA首次将 Harness Layer 引入具身智能。这一思路得到了验证实验发现了惊人的泛化能力。在具有挑战性的 LIBERO-Pro 扰动评估中Harness VLA 达到 82.4% 的成功率显著超过 Pi_RLinf (50%)、NVIDIA Cap-X18.2%和 Berkeley RATS43.8%。整个过程中底层 VLA 全程冻结权重保持不变。更重要的是Harness 并非针对某一特定模型设计而是一种面向系统层的通用框架。除了 VLA它同样能够与 WAM 等具身基础模型结合通过改进模型被组织和调用的方式释放不同基础模型的能力提升复杂扰动环境下的任务成功率为未来具身智能系统提供更加通用的组织方式。这一发现或许意味着具身智能需要经历与数字智能类似的一次范式演进从 End-to-End VLA走向 Harness VLA。论文链接https://arxiv.org/pdf/2607.08448项目主页https://harnessvla.github.io/Harness VLA 重新定义了 VLA 在机器人系统中的执行方式Harness VLA 给出的核心答案不是训练一个更大的端到端 VLA而是让冻结的 VLA 专注于最擅长的接触密集操作并通过一层 Harness Layer 学会如何组织、调用和复用它。图 1 Harness VLA 系统框架。Agentic Planner 在交互过程中不断学习 Primitive 的组织方式并根据环境动态调度解析 Primitive 与 VLA_ACT Primitive。在 Harness VLA 中底层 VLA 被封装为统一的 VLA_ACT Primitive主要负责抓取、放置、按钮按压、抽屉 / 门操作等难以解析建模的接触密集行为而 MOVE_TO、ROTATE_WRIST、SET_GRIPPER、RELEASE 等 Analytic Primitives 负责稳定的空间移动、位姿调整、运输和释放。真正的关键不只是把这些 Primitive 放在一起而是让 Agentic Planner 在闭环交互中学习它们的使用边界哪些阶段应交给 Analytic Primitive哪些局部接触应交给 VLA_ACT PrimitiveVLA_ACT Primitive 调用前需要怎样调整视角和预接触位姿以及一次接触失败后应如何重新 Staging 并再次尝试。因此Harness VLA 并不是执行一套固定流程的调度器它的整个生命周期划分为两个不同的阶段探索式自举阶段Exploratory Bootstrapping Phase和严格的部署评估阶段Deployment Evaluation Phase。它在探索阶段通过环境反馈不断试错记录成功的 Primitive 组合轨迹并将其抽象为 Task Specific Memory同时它把跨任务可复用的成功规则和失败模式沉淀到 Global Memory 中。在新的布局或任务扰动测试阶段下Agentic Planner 不会机械地重复旧坐标而是利用当前观测重新绑定目标和空间位置再根据已有 Memory 组织 Analytic Primitive 与 VLA_ACT Primitive 的组合。从这个意义上说Harness VLA 学到的不是新的底层机器人技能也不是对 VLA 权重的更新而是如何更可靠地使用已有技能它学习 VLA 的适用范围学习 Analytic Primitives 与 VLA Primitive 的组合结构学习失败恢复策略并把这些经验转化为可复用的执行记忆。底层 VLA 始终保持冻结但 VLA 被调用的时机、条件和上下文不断被 Harness 优化从而显著提升整个系统在扰动任务、长程任务和跨场景任务中的执行效率与泛化能力。图 2 Harness VLA 的原理概念图三类任务结果扰动、长程和迁移都达到 SOTAHarness VLA 在三个具有挑战性的机器人操作 Benchmark 上进行评估分别覆盖扰动泛化、家庭厨房长程任务和双臂跨场景迁移。其中LIBERO-Pro 在原始桌面操作任务上引入目标重定向和位置交换等扰动用于测试系统在语义重绑定和空间变化下的鲁棒性RoboCasa365 面向真实家庭厨房式操作包含移动、抓取、放置、抽屉、水龙头、微波炉等长程复合交互用于评估 Harness 对复杂任务的组织、重试和恢复能力RoboTwin C2R 则考察双臂操作从 Clean 场景到 Randomized 场景的迁移进一步验证方法在多臂协作和场景随机化下的泛化能力。在所有评估中Harness VLA 始终基于同一套固定的原语词汇表运行并且不允许在部署阶段引入新的原语。在下文各表中Harness VLA (Codex) 和 Harness VLA (CC) 分别表示使用 Codex 规划器和 Claude Code 规划器实例化的同一套 Harness。基于 Task Specific Memory 的少样本评估 (Few-shot Evaluation)少样本评估的设定为Harness VLA 已经在每个任务的 Seed 0 下通过探索和环境反馈不断试错得到了一条该任务成功的 Primitive 组合轨迹 即 Task-Specific Memory 随后将 Harness VLA 直接应用到该任务的其他 Seed 中测试。这一过程与人类学习过程类似先通过少样本探索学习直至掌握而后自行作业。LIBERO-ProHarness VLA 使用 RLinf 开源的 pi05_libero130_fullshot 模型。表 1 汇总了 LIBERO-Pro 上的实验结果涵盖 SPATIAL、OBJECT、GOAL 和 LIBERO-10 四类任务并分别考虑指令重定向instruction-redirectionT和位置交换position-swapS两类扰动。现有端到端 VLA 模型在这些分布偏移下性能显著下降直接运行 RLinf 开源模型总体成功率为 50.0%。Harness VLA (CC) 将这一结果提升至 82.4%。值得注意的是这一结果也显著超越了领域内提出的 Code as Policy 方案 Cap-X 和 RATS。表 1LIBERO-Pro 上的总体成功率%。「/」表示该结果不可用或未报告。Cap-X 和 RATS 仅报告了 6 个不包含 LIBERO-10 的评测项因此其总体结果仅对已报告的单元格取平均。RoboCasa365RoboCasa365 将评估范围从桌面操作扩展到家庭厨房任务其中包含移动平台预置位、关节式机构操控以及更长的复合操作流程。Harness VLA 使用冻结的 RLDX-1 模型。表 2 显示Harness VLA 将 RLDX 的成功率分别从 60%、21.3%、5% 提升到了 91.6%、56.3% 和 15%达到 SOTA 性能。这些提升与预期的任务分工一致规划器负责导航、预置位以及局部失败后的重新预置位冻结的 VLA 则继续作为局部富接触原语。表 2RoboCasa365 上的成功率%分隔线上方的基线结果来自相应先前论文在 ATOMIC-SEEN、COMPOSITE-SEEN 和 COMPOSITE-UNSEEN 三个评测的报告。不使用 Bootstrapped Harness Memory 的零样本评估Zero-shot EvaluationLIBERO-Pro Goal为了评估 Harness VLA 在不依赖记忆检索时的在线决策能力我们在零样本Zero-shot设定下评估 LIBERO-Pro Goal。在该设定中Harness VLA 不检索目标设定下的 Task Specific Memory也不使用对应的 Global Memory而是仅依赖当前任务指令、实时 RGB-D 观测、机器人状态以及固定的 primitive 接口进行在线决策。表 3 显示零样本 Harness VLA 在两种扰动设定下均优于 Cap-X在位置交换Pos-S设定下达到 31.0%在指令重定向Task-T设定下达到 79.0%相比之下Cap-X 分别为 25.6% 和 16.8%。这一结果说明Harness VLA 的优势不完全依赖记忆检索即使在 zero-shot 下Agentic Planner 仍能在线调用 VLA_ACT 处理抓取、放置等接触密集阶段并结合 Analytic Primitives 完成目标定位、位姿调整和释放因此优于仅依赖解析原语组合的 Cap-X。但 zero-shot 与 few-shot 的差距也表明仅靠在线推理还不足以稳定掌握最优 Primitive 组合尤其在位置交换任务中空间重定位、Staging、运输和失败恢复仍高度依赖 Task Specific Memory 与 Global Memory 中沉淀的执行结构和失败模型。表 3LIBERO-Pro GOAL 上的逐任务成功率%。 比较零样本 Harness VLA 与 Cap-X 的结果Pos 表示位置交换Task 表示指令重定向。RoboTwin C2RRoboTwin C2R 用于评估从 Clean 场景到 Randomized 场景的零样本迁移Agentic Planner 首先在 Clean 设定下探索得到 Task-Specific Memory随后将其直接迁移到 Randomized 任务实例中。在此过程中不进行 Randomized 设定下的自举、不增加额外的任务级探索。表 4 将 Harness VLA 的 C2R 成功率与具有代表性的 VLA 基线进行比较。Harness VLA 达到 58.4%均优于的 47.9%、GR00T-N1.7 的 20.7% 和 StarVLA 的 10.6%。表 4RoboTwin C2R 上的成功率%。 各列比较了在 C2R 设定下具有代表性的 VLA 基线与 Harness VLA 的性能。82.4% 背后是目标、状态和分工三件事Harness VLA 的设计建立在一个关键洞察上许多部署失败并不是 VLA 不会抓取、放置或操作而是它在错误的目标、错误的状态或错误的任务阶段继续执行了一段局部上看似合理的动作。Harness VLA 提升的并不是 frozen VLA 单次动作的能力而是让这些已有能力被用在更正确的地方。第一让 VLA 作用在正确的目标上当指令重新指定目标或者物体与容器交换位置后端到端 VLA 仍可能延续训练时熟悉的目标和空间关系。它的动作可能依然流畅机械臂正常靠近、抓取和放置但服务的对象已经错了。此时失败的原因并不是动作执行不够稳定而是从一开始就选错了目标。Harness VLA 会由 Agentic Planner 根据当前任务指令和 RGB-D 观测重新判断应该操作谁、目标位于哪里再据此组织后续动作。图 3LIBERO-Pro 中的目标重定向与布局交换。如图 3 所示Frozen VLA 容易延续标准任务中熟悉的目标或空间关系Harness VLA 则会重新绑定当前目标再完成空间重定位、Staging 和局部接触操作。因此它首先解决的不是「怎样把机械臂移动得更准」而是「当前究竟应该对谁做什么」。第二让 VLA 在合适的状态中被调用和再次调用即使目标识别正确如果让 VLA 从任意距离、视角或机械臂姿态直接接管它仍可能处在不熟悉的状态分布中。这一问题也是分段解决长程任务会遇到的典型策略衔接问题。Harness VLA 的关键在于它不是简单地把任务切成若干步骤而是通过探索和记忆逐渐学习 VLA 的适用边界什么时候应该先调整空间关系什么时候 VLA 已经处在可接管的局部操作区间什么时候一次接触失败后需要重新 Staging 再次尝试。换言之Harness 学到的不是新的底层动作技能而是如何为 Frozen VLA 创造更合适的调用条件并在调用后根据反馈继续组织执行。调用前让 VLA 从更合适的状态开始工作。这种机制让 VLA 不必从任意状态端到端承担整个任务而是在更接近其优势分布的位置上发挥作用。图 4Harness VLA 对 Frozen VLA 的自适应调用。如图 4 所示Agentic Planner 在移动、Staging、局部接触和状态检查之间闭环切换当局部操作不稳定时系统可以先重新调整操作状态再发起下一次尝试。Harness VLA 没有直接增强 Frozen VLA 的单次局部操作能力而是减少长距离移动、空间搜索和姿态调整对它的干扰让它更多地处理自己擅长的局部接触。调用后根据反馈决定是否再次调用。一次 VLA_ACT 调用并不总能完成整个任务。对于长程操作机器人可能需要在抓取、放置、开关部件等不同阶段分别调用 VLA而当某次局部操作没有取得预期进展时Harness VLA 也可以重新调整状态再次调用 VLA 进行重试。关键在于这并不是让 Frozen VLA 在相同条件下机械地重复执行。每次调用之后Agentic Planner 都会根据新的观测判断当前任务进展并决定是继续执行、使用 Analytic Primitives 重新移动和 staging还是再次调用 VLA_ACT。因此第二次调用所面对的通常已经不是第一次调用时的状态。机器人可能重新调整了机械臂位姿、夹爪状态或与目标的相对位置再让 VLA 从更合适的局部状态重新开始。Task-Specific Memory 保存成功任务中可复用的 Primitive 执行结构Global Memory 则积累跨任务的失败规则和恢复经验帮助 Agentic Planner 判断什么时候需要再次调用 VLA以及调用前应该先进行怎样的调整。图 5不同 VLA Primitive 调用上限下的累计任务成功率如图 5 所示横轴表示每个 Episode 最多允许调用 VLA_ACT 的次数纵轴表示累计任务成功率。随着允许调用次数的增加LIBERO-Pro、RoboCasa365 和 RoboTwin C2R 上的成功率都在最初几次调用后快速上升并逐渐接近完整 Harness VLA 的性能。这说明由 Agentic Planner 完成 Staging 后进行的重复调用确实能够提升成功率但实际所需的调用仍然是稀疏的并不依赖大量反复尝试。换句话说Harness VLA 不再要求 Frozen VLA 一次调用就决定整条任务的成败。每次调用前Agentic Planner 会先判断当前状态是否适合交给 VLA并在必要时完成目标定位、空间调整和 Staging每次调用后系统又会根据新的观测判断是否继续执行、重新调整或在新的局部状态下再次调用 VLA。真正有效的不是单纯「多调用几次」而是在调用前把 VLA 放到更合适的接触起点在调用后用反馈决定是否需要少量而有针对性地再次调用。第三Analytic Primitives 将非接触执行从 VLA 中剥离出来Harness VLA 的一个重要作用是将长程任务中的非接触执行从 VLA 的职责中剥离出来。机器人任务并不是从头到尾都需要学习型视觉运动控制真正依赖 VLA 的通常是局部接触密集阶段而大量中间过程更适合由稳定、可控、可重复的 Analytic Primitives 完成。这种分工减少了 VLA 需要覆盖的任务范围。VLA 不再需要同时承担长距离移动、物体运输、释放和中间状态维持而可以专注于自身最擅长、也最难被解析建模的接触操作。换言之Analytic Primitives 并不是替代 VLA而是把 VLA 从可解析的非接触执行中解放出来使其在更清晰的任务边界内发挥作用。图 6 的任务完成归因直接支持了这一点。在 LIBERO-Pro 系列任务中许多成功 rollout 的最终完成判定发生在 Analytic Primitive 之后说明 VLA 常常只负责建立关键接触而后续完成任务的是非接触执行而在 RoboCasa365 和 RoboTwin C2R 中由于任务末端包含更多机构操作、受约束放置或双臂交互成功更常发生在 VLA_ACT Primitive 之后。不同 Benchmark 中完成归因的差异说明Harness VLA 并不是固定地偏向某一类原语而是根据任务结构将可解析阶段交给 Analytic Primitives将接触密集阶段交给 VLA_ACT Primitive。图 7 的代表性 rollout 进一步展示了这种分工VLA_ACT 负责完成关键接触Analytic Primitives 则负责围绕接触阶段组织非接触执行包括任务推进、状态转换和最终完成。二者结合后Frozen VLA 不再需要端到端承担整条任务而是作为局部接触能力被嵌入到一个更稳定的执行结构中。这些证据共同支持了同一种任务分工Analytic Primitives 围绕富接触阶段组织整个任务而 VLA 仍负责那些需要学习型视觉运动控制的阶段。图 6不同 Benchmark 上的任务完成归因。 柱状图展示了成功 rollout 中最终 Benchmark 完成判定谓词是在 Analytic Primitive 执行后触发蓝色还是在 VLA Primitive 执行后触发橙色的比例。在 LIBERO-Pro 系列任务中VLA 建立稳定接触后任务大多由 Analytic Primitives 完成而 RoboCasa365 和 RoboTwin C2R 包含更多位于任务末端的富接触操作例如机构部件操控、受约束放置或双臂物体交互因此其成功 rollout 更常在 VLA 原语执行后完成。图 7围绕富接触阶段进行解析式分解的代表性 rollout 帧。上排在一个 LIBERO-10-PRO 位置交换任务中智能体首先调用 VLA_ACT随后开始向篮子方向移动但在执行 MOVE_TO 的过程中系统检测到 VLA 实际上并未成功抓住奶油奶酪盒。规划器于是返回目标附近再次调用 VLA_ACT在成功抓取后使用 MOVE_TO 和 RELEASE 完成该子任务。下排在 RoboCasa 的 STEAMINMICROWAVE 任务中智能体首先通过 VLA_ACT 成功抓取碗随后持续搜索并调整位置直到定位到微波炉接着调用 VLA_ACT 将碗放入微波炉并使用 MOVE_TO 将其进一步推入随后关闭炉门最后通过 MOVE_TO 和 NAVIGATE_TO 完成开关按压操作。Harness VLA 的定位Harness VLA 的出现实际上位于三个研究方向的交汇点VLA、Agent 和 Code as Policy。VLA 模型通过端到端学习视觉、语言与动作映射显著提升了机器人在富接触操作中的能力。然而这类模型通常同时承担语言理解、任务规划和低层控制在长时程组合、目标重绑定和分布外部署场景中仍然存在明显局限。Harness VLA 将 VLA 的职责收缩到其最擅长的富接触操作而将目标定位、运动规划、导航等确定性阶段交由智能体和解析式控制完成。另一方面Agent 和 Code as Policy 展示了 Coding Agent 强大的任务规划、工具调用和组合泛化能力但通常依赖解析式原语难以处理复杂的接触操作。Harness VLA 将两类方法结合Agentic Planner 负责基于记忆进行闭环规划、反馈和重规划而 Frozen VLA 作为一种新的高层原语负责执行富接触技能从而在不修改 VLA 参数和不扩展原语库的前提下实现更强的部署泛化能力。Frozen VLA 越强Harness 可调用的能力越丰富Harness 对执行流程的优化又能将这些能力更稳定地转化为完整任务的成功率。开源面向具身智能的智能体化基础设施正如 Harness Layer 推动了 Coding Agent 的快速发展具身智能或许也正在进入一个新的阶段模型负责产生能力而 Harness 负责释放能力。 从「训练一个更强的模型」走向「构建能够持续学习、自主执行、不断进化的智能体系统」基础设施的重要性正在被重新定义。基于这一理念Harness VLA 正式开源并作为 RPentRecursive Physical Agenthttps://github.com/RLinf/RPent 开源生态中的首个核心项目发布。RPent 是由清华大学于超教授团队联合正行创新、无问芯穹共同发起的新一代具身智能开源项目。在此之前团队推出的 RLinf 已成为全球首个面向具身智能大规模强化学习的开源基础设施GitHub Star 超过 4,100入选 PyTorch Ecosystem并被 NVIDIA 官方收录已被多家机器人企业和科研机构广泛采用在具身智能领域产生了广泛影响。如果说 RLinf 的目标是构建具身智能强化学习的训练基础设施Training Infrastructure那么 RPent 的目标则是构建具身智能持续进化的智能体化基础设施Agentic Infrastructure。RPent 以「服务化、标准化、组合化」为核心设计理念将模型、机器人、技能、记忆与环境统一纳入智能体基础设施。通过服务化实现能力解耦通过标准化实现生态连接通过组合化实现智能重构让具身智能系统能够像软件一样被构建、扩展和持续进化。欢迎广大研究者关注仓库贡献代码共同探索具身智能新范式。