VLA:GR00T N1.5 我会把NVIDIA 官方 GR00T N1.5 页面作为主事实源,论文只用于补充官方页面明确指向但未展开的训练目标、数据配方和推理机制;任何无法由两者确认的结构、Shape、冻结状态或 Loss,我都不会补画。接下来我会先核对官方页面与论文中的训练/推理/数据/目标,再按你的节点类型、层级和 Loss 位置规则拆成多张 Mermaid。已确认一个关键差异:N1.5 不再沿用 N1 的“VLM 部分可训练”设定,预训练和微调阶段 VLM 都冻结;同时 DiT 对 VLM 的视觉-语言嵌入做交叉注意力(Cross-Attention),输入还包括机器人状态和加噪动作。官方还明确增加FLARE(Future LAtent Representation Alignment),并给出系数 0.2,因此训练图中的梯度只能指向实际可训练的策略/新增预测部分,不能回指冻结 VLM。下面按你的约束,把GR00T N1.5拆成训练、推理、预训练数据、联合 Loss、Human-video/Robot-data 联合训练 5 张 Mermaid 图。主事实源严格采用 NVIDIA 的GR00T N1.5页面;只有当该页面明确写明“沿用 N1”或直接链接FLARE时,才分别用 GR00T N1 论文和 NVIDIA FLARE 页面/论文展开内部机制。N1.5 官方页面明确说明:采用Eagle 2.5 VLM,VLM 在预训练和微调期间均冻结;DiT 处理机器人状态与加噪动作,并对 VLM 的视觉语言嵌入做交叉注意力(Cross-Attention);训练目标是在 N1 的流匹配损失(Flow-Matching Loss)上加入未来潜表示对齐(Future LAtent Representation Alignment, FLARE),FLARE 系数为 0.2。 turn696693view0有一个必须先说明的真实性(Fidelity)问题:NVIDIA 当前公开的n1d5分支里确实保留了future_tokens,但公开flow_matching_action_head.py的训练 forward 明确注释not using flare now,当前该路径只计算 flow-matching MSE。因此下方“FLARE 联合训练图”表示的是NVIDIA N1.5 Research 页面所述的原始研究训练配方,不是把当前公开 fine-tuning forward 错画成已经实现 FLARE。这个区别我会严格保留。 turn183682view0N1 论文给出的基础流匹配(Flow Matching)目标为:Lfm(θ)=Eτ[∥Vθ(ϕt,Atτ,qt)−(ϵ−At)∥2].(1)\mathcal{L}_{\mathrm{fm}}(\theta)=\mathbb{E}_{\tau}\left[\left\|V_{\theta}\left(\phi_t,A_t^{\tau},q_t\right)-\left(\epsilon-A_t\right)\right\|^2\right].\tag{1}Lfm​(θ)=Eτ​[∥Vθ​(ϕt​,Atτ​,qt​)−(ϵ−At​)∥2].(1)FLARE 所定义的辅助未来表示对齐目标与联合目标为:Lalign(θ)=−Eτ[cos⁡(fθ(ϕt,Atτ,qt),g(ϕt+H))].(2)\mathcal{L}_{\mathrm{align}}(\theta)=-\mathbb{E}_{\tau}\left[\cos\left(f_{\theta}\left(\phi_t,A_t^{\tau},q_t\right),g\left(\phi_{t+H}\right)\right)\right].\tag{2}Lalign​(θ)=−Eτ​[cos(fθ​(ϕt​,Atτ​,qt​),g(ϕt+H​))].(2)L=Lfm+λLalign,λ=0.2.(3)\mathcal{L}=\mathcal{L}_{\mathrm{fm}}+\lambda\mathcal{L}_{\mathrm{align}},\qquad \lambda=0.2.\tag{3}L=Lfm​+λLalign​,λ=0.2.(3)这里的λ=0.2\lambda=0.2λ=0.2也被 N1.5 官方页面明确说明用于预训练(Pre-training)和后训练(Post-training)。1. GR00T N1.5 研究训练流程这一图只画 N1.5 页面能够确认、或由其明确继承自 N1/FLARE 的关系。尤其注意:Eagle 2.5 VLM不接收梯度;实际优化的是动作策略侧,包括 embodiment-specific state/action processing、DiT、动作输出部分以及 FLARE 未来表示预测所需参数。N1 论文明确说明 DiT 的状态/动作编码、交叉注意力以及 embodiment-specific action decoder;N1.5 页面说明其主要变化是冻结 VLM、更新 Eagle 2.5、简化 Adapter 并增加 FLARE。 turn588226view0turn718760view1阶段 4:联合损失与优化目标(Joint Loss and Optimization Objective)阶段 3:动作策略前向计算(Action Policy Forward)阶段 2:流匹配训练输入构造(Flow-Matching Training Input Construction)阶段 1:冻结视觉语言条件编码(Frozen Vision-Language Conditioning)阶段 0:原始训练输入(Raw Training Inputs)子损失(Sub Losses)tauphi_tPredictionTargetPredictionTargetlambda = 0.2GradientGradientGradientGradient数据模块:当前图像观测(Current Image Observation)数据模块:语言指令(Language Instruction)数据模块:机器人本体状态(Robot Proprioceptive State / q_t)数据模块:专家动作块(Expert Action Chunk / A_t)Shape: [B, H, d_a]数据模块:FLARE 目标未来嵌入(Target Future Embeddings / g(phi_t+H))Shape: [B, M, D]冻结模型模块:❄️ Eagle 2.5 视觉语言模型(Eagle 2.5 VLM)结构:Vision Encoder → Simplified Adapter MLP;LayerNorm on visual/text token embeddings → LLM数据模块:视觉语言嵌入(Vision-Language Embeddings / phi_t)Shape: [B, N_vl, d_vl]随机模块:高斯噪声(Gaussian Noise / epsilon)Shape: [B, H, d_a]随机模块:流匹配时间(Flow-Matching Timestep / tau)参数:Beta-based sampling