跳转至

典型模型与论文路线

学 VLA 不建议只追最新模型名,而要看每个模型解决了哪一个关键问题:数据规模、动作表示、连续控制、跨机器人泛化、端侧部署或长程推理。


1. 时间线

时间 模型/工作 关键贡献
2022 RT-1 用 Transformer 学真实机器人控制,强调数据规模和任务多样性
2023 RT-2 把 VLM 接到机器人动作,提出典型 VLA 范式
2023 Open X-Embodiment / RT-X 汇总多机器人数据,推动跨机器人策略学习
2024 Octo 开源通用机器人策略,可用少量数据微调到新机器人
2024 OpenVLA 开源 7B VLA,动作 token 路线的代表
2024/2026 pi0 基于 VLM + flow matching 的连续动作 VLA
2025 FAST 用频域动作 tokenization 改进高频灵巧动作
2025 SmolVLA 面向低成本硬件和社区数据的轻量 VLA
2025 GR00T N1 面向人形机器人的双系统 VLA
2025 Gemini Robotics / 1.5 强调具身推理、长程任务和跨 embodiment
2026 LeRobot 端到端机器人学习工具链,降低采集和训练门槛

2. RT-1:机器人 Transformer 的起点

RT-1 的核心价值是证明:机器人控制也可以从更大、更多样的数据中获益。它还不是今天意义上最完整的 VLA,但它奠定了“用 Transformer 学机器人策略”的路线。

重点读:

  • 如何把图像、语言和动作组织成序列。
  • 数据规模、模型规模、任务多样性如何影响泛化。
  • 为什么机器人数据比互联网文本更难收集。

适合解决的问题:

机器人策略能不能像视觉/语言模型一样从大规模数据中获得可迁移能力?


3. RT-2:VLA 范式成型

RT-2 的关键思想是:把机器人动作也表示成 token,让 VLM 既能回答自然语言,也能输出动作。

它的重要性在于:

  • 使用互联网视觉语言预训练知识增强机器人泛化。
  • 把动作放进和语言相似的生成格式里。
  • 展示了语义推理对机器人任务的帮助。

适合重点看:

  • 动作如何编码成文本 token。
  • 为什么 Web-scale VLM 知识能帮助机器人理解新指令。
  • 语义泛化和真实控制之间的连接。

4. Open X-Embodiment:数据标准化与跨机器人

Open X-Embodiment 的价值在数据层。它把不同机构的机器人数据统一起来,用来训练跨 embodiment 的策略。

学习它时重点不是记住数据集大小,而是理解这些挑战:

  • 不同机器人自由度不同。
  • 相机视角不同。
  • 动作空间不同。
  • 任务和语言标签不同。
  • 数据分布不均衡。

这也是为什么 VLA 需要动作归一化、动作 tokenizer、motion transfer 或 robot-specific adapter。


5. Octo:开源通用策略

Octo 是一个开源 generalist robot policy,强调:

  • 能用语言指令或目标图像作为条件。
  • 能微调到新的传感器和动作空间。
  • 在标准消费级 GPU 上也能做一定实验。

适合新手学习:

  • 通用机器人策略如何组织数据和模型。
  • 如何做少量 in-domain 数据微调。
  • 和 OpenVLA 的自回归动作 token 路线有什么区别。

6. OpenVLA:开源 VLA 主干

OpenVLA 是学习 VLA 结构的重点模型。它的特点:

  • 7B 参数。
  • 基于 Llama 2。
  • 视觉编码器融合 DINOv2 和 SigLIP。
  • 使用大规模真实机器人演示数据训练。
  • 支持 LoRA 微调和量化部署。

适合精读:

  • action_tokenizer:动作如何离散化。
  • 数据 pipeline:如何从机器人轨迹构造训练样本。
  • 微调脚本:如何用少量新任务数据适配。
  • 推理流程:模型输出如何变成机器人动作。

读 OpenVLA 的顺序

先读论文摘要和方法图,再读数据处理和 action tokenizer,最后看训练脚本。不要一上来陷进大模型工程细节。


7. pi0:Flow Matching 连续动作路线

pi0 代表了另一条非常重要的路线:基于预训练 VLM 获取语义能力,再用 flow matching 生成连续动作。

它关注的问题是:

  • 灵巧任务需要更平滑、更高频的连续控制。
  • 单臂、双臂、移动操作等多平台任务需要更通用的策略。
  • 机器人基础模型应能通过微调快速学习新技能。

和 OpenVLA 对比:

维度 OpenVLA pi0
动作形式 离散 token 连续动作/flow
强项 结构清晰、开源易读、微调友好 高频、灵巧、连续控制
学习重点 action tokenizer、VLM 到动作 token flow matching、动作专家、连续轨迹

8. FAST:动作 tokenization 的升级

普通 action tokenization 是逐维、逐时刻分箱。FAST 的思路是把动作序列转到频域再压缩,减少 token 长度,同时保留动作轨迹形状。

适合理解:

  • 为什么高频动作不适合简单 binning。
  • 为什么动作 token 不只是“把数值离散化”。
  • 动作表示本身可以成为一个独立研究方向。

9. SmolVLA:低成本实践路线

SmolVLA 面向“普通人也能训练和部署”的 VLA:

  • 参数量更小。
  • 依赖社区数据和低成本机器人。
  • 支持单 GPU 训练,甚至面向 CPU/消费级 GPU 推理。
  • 使用异步推理,把感知/动作预测和动作执行解耦。

如果你的目标是先跑起来,SmolVLA/LeRobot 通常比直接啃大模型更友好。


10. GR00T N1 与 Gemini Robotics:双系统与具身推理

GR00T N1

GR00T N1 面向人形机器人,采用双系统架构:

  • System 2:视觉语言模块,负责理解环境和指令。
  • System 1:diffusion transformer,负责实时生成动作。

这种结构适合人形机器人,因为全身控制和双臂操作需要高频动作,而高层语义推理不一定需要每一毫秒都运行。

Gemini Robotics

Gemini Robotics 强调:

  • 基于 Gemini 的多模态理解。
  • 直接控制机器人完成复杂操作。
  • Gemini Robotics-ER 负责具身推理,例如空间理解、抓取预测、轨迹理解。
  • Gemini Robotics 1.5 进一步强调“先思考再行动”和 motion transfer。

学习价值:

  • 了解闭源前沿系统关注什么。
  • 理解 VLA 不只是短程抓取,还会走向长程任务规划、进度判断和可解释行为。

11. 新手阅读顺序

建议按下面顺序读:

  1. RT-1:理解机器人 Transformer 和数据规模。
  2. RT-2:理解 VLA 的基本范式。
  3. Open X-Embodiment:理解数据和跨机器人难点。
  4. OpenVLA:精读开源 VLA 的动作 token 与微调。
  5. Octo/SmolVLA:学习更容易实践的开源策略。
  6. pi0/FAST:理解连续动作与高频动作表示。
  7. GR00T/Gemini Robotics:了解双系统、具身推理和前沿趋势。

12. 参考资料