
HOMIE 论文与源码详解人形机器人 Loco-Manipulation、Lower-body RL 与上下肢解耦控制本文结合 HOMIE 论文与 OpenHomie 开源代码拆解其 Observation、Action Space、Upper-body Pose Curriculum、Height Reward、Symmetry Utilization 和 Sim2Real 部署参数。人形机器人真正进入现实环境之后仅仅会走路或者会抓东西都不够。真正有实用价值的人形机器人需要完成走到货架前拿取物体、蹲下捡起地面的瓶子、双手搬着箱子移动、后退的同时拉开柜门以及在手臂持续运动甚至受到外界作用力时保持平衡等任务。这类同时包含移动与操作的任务被称为Loco-Manipulation。图 1HOMIE 的真实世界任务展示截自论文 Fig. 1。Locomotion站立、行走、转向、侧移、蹲起和平衡。Manipulation伸手、抓取、搬运、推、拉以及灵巧手操作。真正困难的地方在于当机器人的上肢开始操作物体时下半身如何继续保持稳定HOMIE 给出了一个非常工程化的答案不要让一个控制器包办所有事情而是把不同身体部位交给最适合它们的控制方式。1. HOMIE 是什么图 2HOMIE 遥操作、下肢策略与数据闭环截自论文 Fig. 2。HOMIE 全称Humanoid Loco-Manipulation with Isomorphic ExoskeletonCockpit。它是一套面向人形机器人 Loco-Manipulation的半自主遥操作系统将机器人控制拆成三部分脚踏板负责输入身体移动意图RL Policy 负责下半身运动和平衡同构外骨骼和动作感知手套分别控制机械臂和灵巧手。Human Operator ├── Pedal │ ↓ │ Locomotion Command │ ↓ │ RL Body Policy │ ↓ │ Lower Body ├── Isomorphic Exoskeleton │ ↓ │ Arm Joint Targets │ ↓ │ Robot Arms └── Motion-Sensing Gloves ↓ Hand Targets ↓ Dexterous Hands这里最重要的设计不是外骨骼本身而是机器人上下肢的控制权被明确拆开。2. 为什么需要半自主架构让操作者直接控制一台二三十自由度的人形机器人并不现实。尤其是腿部控制本质上是高速动态平衡问题。因此 HOMIE 把问题重新分工操作者负责“我要往哪里走、手要怎么操作。”RL 负责“为了实现这个运动意图两条腿具体应该怎么运动并保持平衡。”Pedal Forward ↓ vx 0.5 m/s ↓ RL Locomotion Policy ↓ Lower-body Joint Targets ↓ PD Controller ↓ 机器人稳定向前行走所以 Semi-Autonomous Teleoperation可以理解为人决定运动意图机器人自主解决身体运动和平衡。3. Lower-Body RL普通 Locomotion Policy 通常解决vx / vy / yaw rate → Walking。但 HOMIE 面对一个额外问题上半身并不受 Lower-body RL 控制。操作者可能随时举起手臂、前伸、快速收回或形成严重不对称姿态。这会改变机器人的CoM、转动惯量、Angular Momentum 和 Torso Reaction Torque。因此 HOMIE 的 Lower-body Policy 实际需要同时解决Locomotion Balance Height Tracking Upper-body Disturbance Rejection4. Observation 与控制权解耦HOMIE 的关键设计可以概括为Arm State ∈ Observation Arm Action ∉ Lower-body Action SpaceLower-body Policy 能观察 Whole-body Joint Position / Velocity等状态因此能够感知上肢变化但没有权力修改上肢动作。论文将单步观测写为O_t [C_t, ω_t, g_t, q_t, q̇_t, a_{t-1}]并拼接最近 6 帧O_{t-5:t}作为策略输入。其中q_t与q̇_t覆盖全身关节而策略动作只与下半身关节一一对应。当前开源 G1 配置对应每帧 76 维、6 帧共 456 维观测以及 12 维下半身动作。这使其天然适合未来 VLA只需要把外骨骼产生的 Arm Target 替换成 VLA产生的 Arm Target下半身控制权无需根本改变。5. Action Space 与关键实现参数HOMIE 的 RL Policy 输出下半身关节目标而不是直接控制全部机器人关节Observation ↓ RL Policy ↓ Lower-body Joint Position Target ↓ PD Controller ↓ Joint Torque ↓ Robot这种RL Joint Target Low-Level PD是人形机器人强化学习 Locomotion中非常常见的架构。项目论文/开源 G1 实现强化学习算法PPO仿真环境Isaac Gym4096 个并行环境单步观测Command、机身角速度、投影重力、全身关节位置/速度、上一时刻下半身动作历史窗口6 帧Actor 观测维度456开源 G1 配置Action 维度12 个下半身关节策略频率50 Hz上肢目标重采样间隔1 秒运动命令重采样间隔4 秒需要注意一个版本差异正文方法部分把脚踏命令写为C_t [v_x, ω_yaw, h]附录训练表和当前开源配置还包含横向速度v_y。因此训练策略支持横向速度命令并不意味着论文所示脚踏交互默认同时输出v_y。6. Upper-Body Pose Curriculum图 3HOMIE RL 训练框架来自 OpenHomie 官方仓库。如果训练 Lower-body Policy时上肢永远保持默认姿态真机部署后让操作者自由控制手臂会产生严重Distribution Shift。因此 HOMIE 设计了Upper-Body Pose Curriculum。它不是四个离散阶段而是由上肢动作比例ρ_a控制的连续、自适应课程ρ_a 0 ↓ 从默认上肢姿态开始 速度跟踪奖励达到阈值 ↓ ρ_a 每次增加 0.05 上肢采样分布逐渐展宽 ↓ 最终覆盖完整关节范围论文采用一个在整个[0, 1]区间始终保留非零概率、但会随ρ_a平滑改变难度分布的采样方案避免训练难度突然跃迁。7. 连续上肢运动HOMIE 不只是随机一个静态 Arm Pose。训练中 Upper-body Target会持续变化并进行连续插值从而产生q_arm(t)与qdot_arm(t)。这使 Lower-body Policy 面对的不只是静态姿态变化还包括 Upper-bodyVelocity、Dynamic Inertia、Angular Momentum 和 Reaction Torque。8. Height TrackingLoco-Manipulation 要求机器人能够主动改变身体高度因此 HOMIE 在Locomotion Command 中加入 Target Body Height。机器人可以从站立降低身体、Squat、执行 Manipulation再重新站起从而扩大Manipulation Workspace。9. Height Reward 与 Knee Reward简单使用-|Current Height - Target Height|可能导致 RL为追求高度而产生异常姿态。因此 HOMIE 加入 Knee-related Reward ShapingTarget Height ↓ → Encourage Knee Flexion Target Height ↑ → Encourage Knee Extension这是一种带有身体结构先验的 Reward Shaping。10. Symmetry UtilizationHOMIE 利用 Humanoid 左右对称结构进行Symmetric Data Augmentation例如 Left/Right Joint 对换vy → -vyYaw Rate 取反。Symmetry Lossπ(Mirror(Observation)) ≈ Mirror(π(Observation))这样可以提高 Sample Efficiency并减少左右步态不一致。11. 同构外骨骼传统遥操作通常经历Human Pose ↓ End-Effector Pose ↓ Retargeting ↓ Inverse Kinematics ↓ Robot Joint TargetHOMIE 使用IsomorphicExoskeleton让外骨骼机械结构尽可能与机器人机械臂一致Exoskeleton Joint Angle ↓ Robot Joint Target从而减少 IK、Retargeting、Singularity 和 Latency 问题。12. Hall Sensor GlovesHOMIE 使用 Hall Sensor Motion-Sensing Gloves 感知手指运动再通过Mapping / Retargeting转换为灵巧手目标。这样可以在紧凑、低成本设备中获得较多DoF并适配不同型号的灵巧手。13. 低成本与规模化数据采集HOMIE 强调 Cockpit 成本约 500美元。其意义不只是设备便宜而是降低大规模 Teleoperation Station建设成本为真实机器人数据采集服务。14. Data FlywheelHOMIE 不只是一套 Teleoperation 系统也是一套 Humanoid Data EngineHuman ↓ HOMIE Teleoperation ↓ High-quality Robot Trajectory ↓ Dataset ↓ Imitation Learning / VLA ↓ Autonomous Policy ↓ Robot Deployment ↓ More Real-world Data ↺15. 实验能力论文展示了蹲下抓取胶带、机器人间苹果交接、双手搬箱子、推动椅子、打开烤箱门、拿取番茄、从地面捡瓶子、放置花朵以及在剧烈Upper-body Motion 下保持平衡等任务。这些任务覆盖 Walking、Squatting、Dual-arm Manipulation、Dexterous Hands和 Contact Interaction。16. 与 Whole-Body RL 的区别传统 Whole-Body RLOne Policy ↓ Legs Waist ArmsHOMIEExternal Controller → Arms RL Policy → Lower Body因此 HOMIE 的核心是Control Ownership Decoupling。17. 与相关路线比较作者分析本节用于帮助理解不同控制权划分方式不是 HOMIE 论文给出的统一实验对比各方法的精确定义仍需以其原论文和对应版本为准。方法 核心思路ExBody2 一个 Whole-body Policy上下肢优化目标不同HOMIE External Upper Body Lower-body RLALMI Upper RL Lower RL通过训练互相适应FALCON Upper Agent Lower Agent External ForceHOVER Unified Whole-body PolicyWholeBodyVLA VLA Manipulation-oriented Lower-body RL18. 为什么适合未来 VLA作者分析以下内容是基于 HOMIE 控制接口的架构推演不是论文已经完成的 VLA 实验。HOMIE 当前Exoskeleton ↓ Arm Targets未来可以替换为VLA ↓ Arm Targets形成Vision Language ↓ VLA │ ┌─────┴──────────┐ ↓ ↓ Arm Action Body Command ↓ ↓ Arms Lower-body RL ↓ LegsVLA 可以专注目标理解、Manipulation、Arm Trajectory 和 Body MotionIntention而 Lower-body RL 专门负责 Locomotion、Balance 和 DisturbanceRejection。19. HOMIE 的局限作者分析以下局限综合论文公开内容和当前开源实现得出其中关于未来任务分布的判断不是论文作者的实验结论。19.1 Upper-body Distribution 不等于 VLA Distribution真实 VLA Manipulation 具有 Reach、Grasp、Lift、Pull、Rotate、Place等强任务结构而 HOMIE 的随机姿态与连续过渡不一定完全覆盖。19.2 Hand Payload 建模仍然简化HOMIE 已对左右手附加质量进行随机化论文和当前 G1 源码给出的范围均为每只手[-0.1, 0.3] kg。但这仍是附加在手部 link 上的标量质量扰动不能完整表达不同物体的惯量张量、抓取位置、双手耦合以及随操作过程变化的负载。19.3 缺少系统性的 End-Effector Wrench Curriculum拉门、推箱子、搬运等真实接触操作会产生 External Wrench。HOMIE 展示了一定Contact Robustness但并不等于训练阶段系统覆盖了 Force Distribution。19.4 Locomotion Command 仍偏传统未来 Manipulation-oriented Locomotion 可能需要更精确的 StepDisplacement、Body Position、Turn Angle、Pelvis Target Pose 和 StanceAdjustment。20. 从 HOMIE 到 VLA-ready Lower-body Controller作者建议以下方向是在 HOMIE 基础上的扩展设想尚未由本文所述 HOMIE 实验验证。可以在 HOMIE 基础上进一步加入HOMIE Baseline ├── VLA-like Arm Trajectory Curriculum ├── Richer Payload / Object Inertia Randomization ├── End-Effector Wrench Randomization └── Precise Locomotion / Body-position Command同时可以考虑将 Arm Target、甚至 Future Arm Action Chunk 加入 Lower-bodyObservation使控制器从 Reactive Disturbance Rejection 向 PredictiveCompensation 演进。21. 总结HOMIE 表面上是一套低成本 Humanoid TeleoperationCockpit但背后真正值得关注的是一种清晰的人形机器人控制哲学不同身体部位应该交给最适合它们的控制方式。HOMIE 最值得记住的三个设计理念是上肢和下肢控制权解耦下肢策略主动适应持续变化的上肢Teleoperation 不只是为了遥控更是为了建立 Data Flywheel。这使 HOMIE 不仅是一套遥操作系统也成为未来VLA 上肢 RL下肢分层具身智能架构的重要参考。论文与项目资源论文HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit开源代码InternRobotics/OpenHomie图片来自 OpenHomie 官方仓库版权归项目与论文作者所有仅用于技术解读CSDN 稿通过 jsDelivr CDN 加载官方图片。