GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
2026/9/28
来源:arxiv2503
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
NVIDIA · arXiv:2503.14734 · 2025 年 3 月
Takeaway Message: GR00T N1 是 NVIDIA 提出的一种面向通用人形机器人的 Vision-Language-Action(VLA)基础模型。论文的核心思想是将负责视觉语言理解的 VLM(System 2)与负责连续动作生成的 Diffusion Transformer(System 1)结合,并通过真实机器人数据、仿真数据和人类视频的联合预训练,构建能够跨机器人本体迁移、快速适应新任务的通用操作策略。相比单纯提出一种新的网络架构,GR00T N1 更值得关注的是它对**通用机器人基础模型如何实现数据规模化训练(Data Scaling)**给出了一套较为完整的方案。
通用机器人基础模型的研究,很大程度上受到 LLM 和 VLM 成功经验的启发。大语言模型通过海量互联网文本预训练,获得了强大的通用知识和迁移能力,因此一个自然的设想是:能否类似地收集大量机器人操作数据,训练一个通用的机器人策略,使其能够理解不同的语言指令,并在不同机器人、不同场景中完成操作?
然而,机器人学习与语言建模存在一个根本性的区别:互联网包含大量自然语言和图像,却不存在一个规模相当的机器人动作数据互联网。 真实机器人数据需要依靠遥操作或自主探索采集,成本高昂,而且不同机器人之间的本体结构(Embodiment)、自由度、控制方式和传感器配置存在显著差异。即使将不同机器人的数据汇总起来,也往往形成相互隔离的 Data Islands,难以直接用于统一训练。
现有的机器人模仿学习方法,例如 Behavior Cloning 和 Diffusion Policy,已经能够在特定任务上取得较好的效果,但通常仍依赖大量与目标机器人、目标任务直接相关的示范数据。Open X-Embodiment 等工作尝试通过汇集不同机器人的数据缓解这一问题,但跨本体的动作表示不统一,以及高质量机器人数据的整体规模不足,依然限制着基础模型的进一步发展。
因此,GR00T N1 希望解决的不仅是如何预测机器人动作,而是两个相互关联的问题:如何设计一种既能利用预训练视觉语言知识、又能适应不同机器人动作空间的统一 VLA 架构;以及如何利用原本不具备机器人动作标签的海量视频数据,扩大机器人策略的训练规模。
针对第一个问题,作者采用了一种受人类双系统认知理论启发的架构,将机器人策略拆分为 System 2 和 System 1。System 2 负责理解视觉场景和语言任务,System 1 则根据这些语义信息与机器人的当前状态,生成连续的底层控制动作。这里的 System 1/2 并不是两个独立运行、通过自然语言传递指令的智能体,而是两个紧密耦合、联合优化的神经网络模块。
论文 Figure 3:GR00T N1 的核心架构
【VLAs篇】01:GROOT N1—面向通用人形机器人的开放基础模型-CSDN博客
具体而言,System 2 采用预训练的 Eagle-2 VLM,其中包含 SigLIP-2 视觉编码器和基于 SmolLM2 的语言模型。机器人输入当前的视觉观测和自然语言指令,VLM 将其编码为视觉语言特征,提供关于环境、目标物体和任务语义的信息。System 1 则采用基于 Flow Matching 的 Diffusion Transformer(DiT),以视觉语言特征、机器人自身状态(Proprioceptive State)和带噪声的动作序列为条件,经过迭代去噪生成未来一段连续动作。
在这一过程中,两个系统主要通过 Cross-Attention 进行信息交互。DiT 内部的动作特征通过 Cross-Attention 读取 VLM 输出的视觉语言 Token,同时利用 Self-Attention 建模机器人状态和动作序列之间的关系。因此,VLM 不直接负责预测关节角度或末端执行器位姿,而是提供语义条件;实际动作生成由专门训练的 DiT 完成。
这种设计还有一个重要优势:不同机器人可以共享 VLM 和 DiT 的主体参数,只需要使用 Embodiment-Specific State/Action Encoder 和 Decoder,将不同维度的状态、动作映射到统一的特征空间,再转换回对应机器人的控制空间。由此,一个统一模型就能够支持单臂机械臂、双臂机器人和具有灵巧手的人形机器人,而不必为每一种机器人重新构建完全独立的策略。
在实际推理中,GR00T N1 采用 Action Chunking,一次生成未来连续 16 个时间步的动作,并通过闭环执行不断更新。与逐 Token 自回归生成离散动作的 VLA 不同,Flow Matching 允许模型直接生成连续动作轨迹,更适合机器人对平滑、高频控制的需求。论文报告的 GR00T-N1-2B 总参数量约为 2.2B,在 L40 GPU 上生成一个 Action Chunk 的推理时间约为 63.9ms。这说明作者不仅关注通用性,也尝试兼顾真实机器人部署所需的推理效率。
不过,网络架构实际上只解决了数据利用问题的一部分。GR00T N1 更具特色的贡献来自第二个方向:通过 Data Pyramid,将不同来源、不同规模、不同可靠程度的数据组织到统一的训练体系中。
作者认为,真实机器人数据虽然最贴近实际控制需求,但获取成本最高、规模最小;人类视频虽然没有机器人的控制信号,却蕴含大量关于物体交互、任务执行和运动规律的信息,而且规模远大于机器人数据。因此,论文将训练数据组织为三个层次:底层是互联网视觉语言数据与人类视频,中间层是仿真轨迹和生成式视频构成的合成数据,顶层则是少量高质量真实机器人轨迹。
论文 Figure 1:Data Pyramid
| [GR00T N1: An Open Foundation Model for Generalist Humanoid Robots | alphaXiv](https://images.openai.com/static-rsc-4/RejcFAOyX_Vw_zPXEUZ1uFITGtfa33D9WdDhZGsVkf1Ugausn01RuwGZN4rV1W-c171ejNzSCSGwlStOUxsJ3RLfQCDo9B0JV1asfIiEHRhskGi5SeleUOmyExnTUg1BCats_jzN5WrKq9A1nXwBYoUd5V8wJ3HLOhnZt0Z3q30?purpose=inline) |
这里存在一个关键困难:真实机器人轨迹通常具有明确的 Action Label,但人类视频和生成式视频只有连续的图像帧,并不知道对应的关节动作或末端执行器控制量。若无法将这些视频转换为可供机器人策略学习的数据,视频规模再大,也难以直接参与 VLA 的动作训练。
为此,作者采用了两种互补的技术:Latent Action Learning 和 Inverse Dynamics Model(IDM)。
对于 Latent Action Learning,论文沿用 LAPA 的思路,通过 VQ-VAE 学习相邻时间窗口中视觉变化所对应的隐式动作表示。模型根据当前图像和未来图像提取 Latent Action,使不同本体执行的相似行为能够映射到具有一定共享语义的动作空间。例如,无论是人类还是不同类型的机器人,将右臂向左移动,都可能对应相近的 Latent Action 表示。这样,人类视频虽然没有真实机器人控制标签,也可以通过学习得到的隐式动作作为监督信号参与预训练。
另一种方法是利用 IDM,根据前后视觉观测推断可能产生这些变化的机器人动作,从而生成更加接近目标机器人动作空间的 Pseudo-Action Label。两种方法并不完全等价:Latent Action 更强调跨本体的共享运动表示,而 IDM 则试图恢复具有实际控制意义的动作。GR00T N1 根据数据类型和训练阶段分别使用这两种方法,使缺乏原始控制信号的视频也能被纳入统一的 Flow Matching 训练目标。
除了为现有视频生成动作标签,作者还进一步利用视频生成模型主动扩展训练数据。具体来说,先使用真实机器人遥操作轨迹微调 Image-to-Video 生成模型,再以已有场景图像和新的语言指令为条件,生成机器人在不同任务、不同物体配置下执行操作的视频。这种方式能够产生大量 Counterfactual Trajectories,即在相同或相似初始场景下,针对不同目标所产生的假设性操作轨迹。
例如,在同一个桌面场景中,原始示范可能只有将苹果放入篮子的操作,而视频生成模型可以产生使用另一只手、操作不同物体或者放置到不同容器的轨迹。随后,利用 Latent Action 或 IDM 为生成视频提供伪动作监督,再参与 VLA 训练。论文将内部采集的 88 小时真实遥操作数据扩展为约 827 小时生成视频,接近 10 倍规模。
另一方面,对于能够在物理仿真中可靠执行的操作任务,作者采用 DexMimicGen,对少量真实示范进行物体中心的轨迹分段、坐标变换和重组,并在仿真中验证成功后保留,自动生成大量机器人操作轨迹。与神经视频生成不同,这些仿真轨迹可以直接获得机器人状态和动作标签。论文报告,整个系统生成了约 78 万条仿真轨迹,相当于约 6500 小时操作数据。
这三类数据最终被纳入统一的训练过程:模型在不同机器人本体、不同任务和不同数据来源之间联合预训练,使共享参数学习更广泛的视觉语义、运动规律和操作技能。预训练完成后,再使用某个具体机器人和目标任务的少量示范进行 Post-training,使模型适应该机器人的动作空间及实际控制特性。
这一训练范式的核心价值,是将机器人学习从完全依赖目标任务示范的模式,转向"大规模异构数据预训练 + 少量目标任务数据适配"的模式。 它与 LLM/VLM 的预训练和下游微调具有相似的思想,但为了适应机器人物理控制的特殊性,额外解决了跨本体动作表示、视频动作标签缺失,以及合成数据与真实执行之间的差距。
为了验证这一思路,论文在 RoboCasa、DexMimicGen Cross-Embodiment Suite 和 GR-1 Tabletop Tasks 三组仿真基准上进行测试,覆盖单臂操作、双臂协调和人形机器人灵巧操作等不同任务。作者主要将经过预训练和后训练的 GR00T N1 与从头训练的 BC Transformer、Diffusion Policy 比较,以评估基础模型预训练能否提升下游任务的学习效率。
在每个任务使用 100 条示范的设置下,GR00T N1 在三组基准上的平均成功率分别达到 32.1%、66.5% 和 50.0%,整体优于两种基线。在真实 Fourier GR-1 人形机器人上,使用完整示范数据时,GR00T N1 的平均任务成功率达到 76.8%,而 Diffusion Policy 为 46.4%;即使 GR00T N1 只使用 10% 的下游示范数据,其成功率也能达到 42.6%,接近使用全部数据训练的 Diffusion Policy。
这些实验支持了论文最重要的假设:大规模异构数据预训练能够为机器人提供可迁移的视觉、语义和运动先验,从而显著降低学习新任务所需要的真实机器人示范数量。
此外,作者还检验了 Neural Trajectories 对 Post-training 的帮助。在低数据量条件下,将生成视频与真实轨迹联合训练,能够进一步提高仿真和真机任务成功率,说明生成式视频不仅能够服务于基础模型预训练,也有潜力成为下游任务数据增强的一种有效方式。
不过,这些结果还不能意味着 GR00T N1 已经实现了真正意义上的通用人形机器人控制。论文中的实验主要围绕桌面物体操作、双臂协作和灵巧手控制展开,并未系统证明模型具备复杂环境中的自主移动、全身动态运动或长期任务规划能力。虽然它采用了 System 1/System 2 的双系统设计,但 System 2 在这里主要承担视觉语言特征提取,而不是显式的多步规划或独立高层推理。
此外,合成视频的真实性、伪动作标签的准确性,以及不同机器人本体之间的知识迁移程度,仍是这一框架的关键限制。论文也观察到一个值得注意的现象:经过特定任务 Post-training 后,预训练模型原本具备的部分双手交接能力反而可能丢失。这表明通用预训练技能与下游专用化之间仍然存在一定冲突。
总体而言,GR00T N1 的重要性并不主要体现在提出了全新的动作生成算法,而在于将预训练 VLM、Flow Matching Action Policy、跨本体训练、Latent Action Learning 和大规模合成数据整合成一套相对完整的机器人基础模型训练体系。它所展示的核心方向是:要让机器人基础模型真正获得类似视觉语言模型的 Scaling 能力,除了扩大模型参数规模,更重要的是突破真实机器人数据稀缺这一限制,使人类视频、仿真轨迹和生成数据能够共同参与机器人的动作学习。
对于后续深入阅读,我认为这篇论文最值得进一步分析的是三个相互关联的问题:System 1 和 System 2 之间具体如何通过 Attention 交互;跨 Embodiment 的状态和动作空间如何实现统一;以及 Latent Action、IDM 和真实动作标签究竟如何在预训练过程中共同发挥作用。这些也是理解 GR00T N1 与 π0、π0.5 等 VLA 模型在架构和训练范式上差异的关键。
主要依据:论文第 1–4 节及第 6 节,尤其 Figure 1、Figure 3、Table 2、Table 3。以上为首轮导读,对技术细节作了有意压缩。