【IROS 2026】WayFinder:分层视觉-语言-动作,零样本航点生成与低层运动控制|从无人机自主导航视角 摘要本文解读 IROS 2026 论文《WayFinder: Hierarchical Visual-Language-Action for Zero-Shot Waypoint Generation and Low-Level Kinematic Control》。该论文提出WayFinder一个端到端闭环的分层 VLAVision-Language-Action自主导航框架通过融合零样本多模态大模型MLLM的高层战略推理、高频深度强化学习DRL的低层运动控制与射线追踪构建的 RGB 语义状态图让无人机在未知环境中脱困其特别之处在于把大模型降级为只在进展停滞时才触发的恢复层。实验表明在四张 AirSim 地图上成功率提升 1.8227.45 个百分点AirSimNH 从 84.91% 提升到 96.09%且恢复率随 Gemma 3 参数规模4B/12B/27B单调上升为算力受限的具身智能部署提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么 VLA 一上机器人就卡壳三条相关工作线的局限研究主线从问题到结论基准/方法设计分层解耦让谁负责什么分类全景状态图用强对比图元迎合视觉编码器方法细节触发、坐标接地与训练可行性视觉状态图的八层语义编码实验设计与结果评测协议主结果完全可观测地图下的导航成功率部分观测地图性能不降反升消融研究每条设计选择都被单独钉死结果对比总结关键发现局限性常见问题FAQWayFinder 需要微调大模型吗为什么不每一步都问大模型为什么用部分观测地图反而比真值地图更好低层策略为什么用 DQN 而不是连续控制这套框架能迁移到别的机器人上吗评估用了多少数据参考链接论文基本信息项目内容标题英文WayFinder: Hierarchical Visual-Language-Action for Zero-Shot Waypoint Generation and Low-Level Kinematic Control标题中文分层视觉-语言-动作零样本航点生成与低层运动控制作者Timothy K Johnsen, Marco Levorato机构University of California, Irvine · San Diego State University会议IROS 2026IEEE/RSJ International Conference on Intelligent Robots and SystemsarXivarXiv:2609.37922项目网站github.com/WreckItTim/OmniNaviPy背景与动机为什么 VLA 一上机器人就卡壳视觉-语言-动作模型的开放世界泛化能力有目共睹但把它真正部署到移动机器人上有两个绕不开的瓶颈其一算力开销与移动平台的硬件约束直接冲突持续高频推理在轻型平台上难以维持其二大模型输出具有随机性与黑箱特性而实时运动控制需要的是确定性的安全保证。现有路线普遍依赖后训练、微调或蒸馏把大模型知识绑定到特定机器人本体。但微调不仅计算昂贵在专门的空中导航任务上还几乎不存在大规模高质量示范数据损失函数对泛化指令本身也不友好。三条相关工作线的局限经典无地图导航人工势场、向量场直方图有确定性的安全保证、计算高效但容易陷入局部极小在遮蔽严重的环境里难以脱困。DRL 无地图导航把导航建模为马尔可夫决策过程用深度 Q 网络DQN把高维深度感知直接映射为运动指令可扩展性强但缺乏语义常识分布外泛化误差明显。VLA 基础模型RT-2、OpenVLA开放世界泛化能力突出代价是持续推理开销与昂贵的微调。与本文最接近的是 2023 年 CoRL 的LM-Nav它同样把语言模型当作高层规划器通过 CLIP 接地把指令转成视觉接地航点再交给既有低层导航模块执行——但它依赖完全可观测的全局信息也缺少针对停滞的恢复机制。WayFinder 的关键差异是把这条零样本分层范式做成闭环状态图由机载深度射线追踪在线生成并显式加入停滞 → 恢复的触发逻辑从而消除人工接管。从更大的历史脉络看这条路线是两个范式线的竞争与合流分层线2023 年 LM-Nav语言规划器 既有执行接口与端到端线2023 年 RT-2首个把动作离散成 token 的 VLA泛化跃升但微调成本高企。2024–2025 年分层 VLA 重回导航任务——NaVILA 用中层语言动作驱动视觉运动强化学习策略VAMOS 做成可转向的分层视觉-语言-动作模型FASTNav 则用 LoRA 微调的小语言模型把指令跟随做到机载实时。2026 年的 WayFinder 是两条线的合流既保留大模型式的推理能力又保留分层架构的确定性控制而且大模型全程零样本、只在停滞时触发。研究主线从问题到结论图 2WayFinder 研究主线Mermaid 流程图——从 VLA 部署双瓶颈出发放弃微调、改走分层异步架构由停滞触发零样本航点生成最终在四张地图上取得 1.8227.45 个百分点的成功率增益基准/方法设计分层解耦让谁负责什么WayFinder 的核心设计是把导航显式拆成默认模式与恢复模式默认模式低层 DQN以长度 $\tau3$ 的滑动时间窗为状态包含 $144\times256$ 的深度图 $\mathbf{D}$、相对目标或当前航点的局部 GPS 坐标 $\mathbf{c}$ 与 IMU 航向 $\theta$输出离散的平移与偏航指令并配有确定性的短程碰撞规避机制——障碍物一旦被检出就立即中止本次运动从物理上避免碰撞。恢复模式高层 MLLM当滚动窗口内的最大前进量 $\Delta\rho_t d_{t-N} - \min_{k\in[t-N,t]} d_k$ 低于阈值 $\epsilon$ 时触发标志位 $T_t$把在线构建的 RGB 状态图 $M_t$ 与结构化语言提示一起送给零样本 Gemma 3返回的坐标替换当前目标抵达航点后目标复位为全局终点重新交回低层策略。图 1WayFinder 总体框架——闭环自主栈对传感器作出运动学响应仅在检测到停滞时查询 MLLM 生成新航点原论文 Fig. 1分类全景状态图用强对比图元迎合视觉编码器$M_t$ 是一张 2D 俯瞰 RGB 图用强对比的基础图元编码全部语义。设计动机很直接当代 MLLM 的视觉前端如 SigLIP对强对比、语义清晰的图元 token 化得更稳、更准比直接送 RGB-D 原始观测更省 token。图 3WayFinder 的分层职责划分Mermaid 树状图——低层 DQN 消费深度图与相对 GPS/IMU 航向高层零样本 MLLM 消费 RGB 语义状态图与结构化坐标提示方法细节触发、坐标接地与训练可行性三个工程细节决定了这套设计能不能跑起来稀疏触发条件大模型只在 $\Delta\rho_t \epsilon$ 时被调用。作者明确指出每步查询既低效算力开销大又无效会诱发偏离良好轨迹的幻觉因此触发后还要重置时间窗避免连续误触发。语言坐标接地MLLM 在视觉预处理阶段会做动态重缩放与分块Pan Scan这会打断像素索引与空间坐标的对应关系SigLIP 这类 tokenizer 进一步加剧映射复杂度。因此提示词必须显式给出起点、当前位置、目标与历史路径点的坐标与图上的坐标轴刻度互相锚定以压掉空间歧义。状态缓存与离散化训练前预先离散化导航空间、缓存全部自视角深度图与碰撞布尔量用直接采样代替仿真渲染把 DQN 训练时间从数周压到数小时再配合 100 GB 回放池、课程学习、随机回采与早停缓解灾难性遗忘。离线 A* 则用于量化每条路径的难度并划分训练/验证/测试集。视觉状态图的八层语义编码$M_t$ 自下而上依次绘制黑自由空间可通行、白障碍不可通行、灰未确定区域随后是紫色历史轨迹线与圆点、红色三角表示此前生成过的航点让模型记住哪些恢复尝试已失败避免重复建议同样的解、绿色十字起点、蓝色方块当前位姿 $\mathbf{p}_t$、黄色星形全局目标 $\mathbf{g}$。世界地图更新时用掩码保证只有新观测到的自由/占据单元才覆盖旧值从而在持续更新的同时保留已探索区域的记忆。实验设计与结果评测协议实验全部在 Microsoft AirSim 高保真物理与图形仿真器中完成覆盖四张复杂度递增的地图Blocks最简稀疏几何障碍、通视良好、AirSimNH城郊含房屋、道路、树木、车辆也是低层策略唯一的训练域、CityEnviron密集都市含复杂路口与大型建筑、Coastline面积最大含开阔海洋与海岸公路与训练域分布偏移最严重。评测集由离线 A算法生成静态留出集共4,000 条路径每条都验证过存在可行解评测固定随机种子并把 MLLM 的 temperature 设为 0。为量化算力与可靠性的权衡高层策略分别使用 Gemma 3 的4B / 12B / 27B* 三个参数规模。主结果完全可观测地图下的导航成功率该设置直接使用 AirSim 的真值占据栅格绕过射线追踪模块为 MLLM 建立性能上界。高层模型AirSimNHBlocksCoastlineCityEnviron无纯低层基线84.91%83.71%63.73%44.55%Gemma3:4b92.91%89.57%69.64%57.91%Gemma3:12b94.55%88.71%73.00%64.27%Gemma3:27b96.09%92.43%77.73%70.73%27b 相对基线增益11.18 pt8.72 pt14.00 pt26.18 pt低层 DQN 只在 AirSimNH 训练因此基线在其他三张地图上退化明显CityEnviron 仅 44.55%这正是分布外泛化误差加入零样本 MLLM 后四张地图全部提升且随模型规模单调上升说明推理能力与参数规模强相关。部分观测地图性能不降反升把真值栅格换成由机载深度射线追踪在线构建的部分观测 $M_t$ 后恢复率成功恢复的 episode 占比依然稳健27B 甚至在若干地图上反超高层模型AirSimNHBlocksCoastlineCityEnvironGemma3:4b54.82%28.95%25.81%25.08%Gemma3:12b65.06%36.84%41.60%36.07%Gemma3:27b80.72%64.91%53.63%50.82%失败恢复率同样极低27B 在 AirSimNH 仅-0.64%最高的 Coastline 也只有-7.85%——而 Coastline 恰好是分布偏移最大、空间最开阔的地图。消融研究每条设计选择都被单独钉死默认配置使用 Gemma 3 (27B)、部分观测 $M_t$ 与完整的路径/航点历史聚合恢复率 56.79%相对路径长度归一化为 1.00。配置默认27B 部分观测 $M_t$ 全量历史恢复率相对路径长(I) WayFinder 默认设置56.79%1.00(II) 换用 Gemma3:4b30.88%1.17(III) 换用 Gemma3:12b41.74%1.17(IV) 语言提示去掉坐标12.26%1.46(V) 去掉航点历史48.02%0.99(VI) 去掉视觉组件55.62%1.10(VII) 去掉路径历史52.37%1.12(VIII) 换用真值占据栅格53.45%1.05结果对比总结图 4结果对比总结Mermaid 流程图——零样本恢复层把基线 84.91%/44.55% 提升到 96.09%/70.73%同时标出三项关键消融的恢复率下降关键发现零样本恢复层几乎抹平了分布外泛化误差27B 模型把 AirSimNH 成功率从 84.91% 提到96.09%把 CityEnviron 从 44.55% 提到70.73%最大增益26.18 个百分点。部分观测地图不是短板改用射线追踪 $M_t$ 后27B 在 AirSimNH 的恢复率反而升到80.72%Blocks64.91%Coastline53.63%CityEnviron50.82%。失败率极低27B 在 AirSimNH 的失败恢复率仅-0.64%说明大模型给出的航点绝大多数是有效航点而不是随机扰动。语言坐标是硬约束而非可选项消融 (IV) 去掉提示词中的显式坐标后恢复率从 56.79%崩到 12.26%相对路径长度从 1.00 涨到1.46证明视觉与语言必须互相锚定。更完美的地图反而更差消融 (VIII) 用真值占据栅格替换射线追踪地图恢复率从 56.79% 降到53.45%——局部、带不确定性的机器人视角反而逼迫模型按机器人自身视角推理是有益先验。没有记忆就会打转消融 (V) 去掉航点历史降到48.02%原因是无记忆的 MLLM 会反复生成同一个已失败的航点把机器人困在死循环里。从创新模式的视角看WayFinder 命中的是异构分解差异化处理常规态交给 DQN、停滞态交给 MLLM、分解并委托求解器两个求解器各有明确适用边界且能力边界被显式扫描与通过条件化适配而非重训练Gemma 3 权重全程冻结适配全部由状态图 坐标提示这对条件承担三条模式。它的贡献重心是造出别人能直接复用的东西开源数据集、完整仓库以及与具体机器人无关的分层契约。局限性仅仿真验证全部结论来自 Microsoft AirSim没有真机部署且作者只从无人机视角考察作者也坦承存在 sim-to-real 缺口。动作空间离散平移与偏航被量化为有限集合连续执行依赖一个被假设存在的机载飞控固件不同固件需要重新适配。停滞检测有假阳性机器人在绕行大型障碍时可能被误判触发 MLLM 查询。扩大时间窗 $N$ 可以缓解但会延迟检测并需要放宽最大步数限制 $L$——最优 $N$ 取决于具体任务。坐标映射脆弱MLLM 的动态重缩放与分块会打断像素索引与空间坐标的对应目前只能靠语言提示中的显式坐标兜底只有最大的 27B 模型在使用真值栅格时才表现出稳定增益。写作层面的瑕疵原文存在若干拼写与语法问题如 Configuation应为 Configuration、datasets are no only highly specific应为 not only、缺撇号的 the robots egocentric depth sensors以及 between ... to ... 的搭配错误另有两处引用命令被注释掉LeCun 2002 / Rumelhart 1986导致句末出现孤立逗号。常见问题FAQWayFinder 需要微调大模型吗不需要。Gemma 3 的权重在整条流水线中全程冻结任务适配完全由RGB 语义状态图 结构化坐标提示这对条件承担。三个参数规模4B/12B/27B可以在零重训练的前提下直接互换。为什么不每一步都问大模型两个理由。效率上每步查询会带来无法承受的推理开销效果上作者明确观察到高频查询会诱发幻觉使航点偏离良好轨迹。因此 WayFinder 采用稀疏触发只在滚动窗口内的最大前进量 $\Delta\rho_t$ 低于阈值 $\epsilon$ 时才查询并在查询后重置时间窗。为什么用部分观测地图反而比真值地图更好真值栅格给出的是全局、完美但非自我中心的视图射线追踪得到的是局部、带不确定性、以机器人为原点的视图。消融 (VIII) 显示前者使恢复率从 56.79% 降到 53.45%说明后者的机器人视角本身就是一种有效的归纳偏置迫使模型按机器人能看到什么来推理。低层策略为什么用 DQN 而不是连续控制因为任务被显式设计为离散运动原语的选择问题从有限的平移米与偏航度集合中选一个动作。离散化大幅压缩了探索空间让 DRL 收敛更样本高效同时连续的加速度执行交给机载飞控负责。这一分层也让高层的输出一个航点坐标天然可以复用。这套框架能迁移到别的机器人上吗作者持乐观态度因为 MLLM 始终零样本、只当故障恢复器方法原则上可迁移到 DRL 之外的多种低层控制器。但需要两个前提——低层控制器本身足够可靠且高层能获取构建状态图所需的深度/定位信息。评估用了多少数据评测集是离线 A* 生成的静态留出集共 4,000 条路径每条都验证过存在可行解评测固定随机种子并把 MLLM 温度设为 0。作者提到跑满全部样本4,400 条路径需要接近一整天因此部分实验只比较恢复率这一维度。参考链接论文 arXiv 摘要页arXiv:2609.37922官方开源仓库数据集 完整流水线github.com/WreckItTim/OmniNaviPy作者讲解视频YouTubeLM-Nav分层零样本导航的直接前身arXiv:2207.04429RT-2首个 VLA端到端范式起点arXiv:2307.15818OpenVLA开源 VLA 基础模型arXiv:2406.09246NaVILA分层 VLA 导航arXiv:2412.04453VAMOS可转向的分层视觉-语言-动作导航模型arXiv:2510.20818FASTNav机载实时指令跟随IEEE RA-L 2024综述Foundation Models in Robotics: A Comprehensive ReviewarXiv 2026综述Large Model Empowered Embodied AI SurveyarXiv:2508.10399给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件