VLA技术架构演进¶
RT-1¶
解决问题¶
在 RT-1 之前,机器人学习通常有三个明显问题。 一个任务训练一个模型、训练模型泛化能力弱、Transformer 太慢不容易实时控制。
RT-1 是一套比较明确的固定架构。
技术架构¶

最近6帧机器人相机图像
+
自然语言任务指令
↓
USE语言编码器
↓
FiLM条件化的 EfficientNet-B3
↓
每帧产生81个视觉语言Token
↓
TokenLearner:每帧压缩为8个Token
↓
6帧合计48个Token
↓
8层 Decoder-only Transformer
↓
离散动作Token
↓
反量化为机器人控制指令
↓
机器人执行,获得新图像,再次预测
-
USE 只是一个句子编码器,并不是今天意义上的大型语言模型。
-
其中FiLM-EfficientNet属于一种早期视觉语言融合:语言不是等图像处理完以后才参与决策,而是在视觉特征提取阶段就开始影响模型。 FiLM 可以简单理解为:
h′=γ(l)⊙h+β(l)
其中:
h:当前视觉特征; l:语言指令向量; γ(l)、β(l):由语言指令生成的调节参数。
直观上,如果指令是:“抓取红色罐子”,语言信息就会让视觉网络更关注: 红色区域; 罐状物体; 与抓取有关的边缘和几何特征; 而相对忽略桌面上的其他干扰物。
最终效果¶
在训练任务上的成功率达到约 97%,模型能够以大约 3 Hz 的频率进行闭环控制。
RT-1 虽然能够泛化,但这种泛化主要还是:对机器人训练数据中已有概念和动作的重新组合。
RT-2¶
解决问题¶
RT-1 会控制机器人,但是机器人数据中的知识太少。互联网视觉语言模型懂很多知识,但是不会控制机器人。RT-2把这2者结合起来。
- 解决方法:使用大型预训练 VLM; 把机器人动作表示成文本 Token; 同时使用互联网视觉语言数据和机器人数据进行 co-fine-tuning。
RT-2 像一种 VLA 改造方法或训练范式: 任何能够接收图像和文本、输出文本 Token 的视觉语言模型,都可以通过动作 Token 化和联合微调,改造成机器人控制模型。
RT-1 使用机器人专用 Transformer 输出动作分类结果,而 RT-2 使用大型 VLM 的文本输出接口生成动作 Token。
技术架构¶

-
RT-2训练
RT-2 没有只拿机器人数据微调 VLM,而是同时保留两类数据。论文中的消融实验显示,只用机器人数据微调,更容易损伤模型原来学到的视觉语言知识;将原始视觉语言数据继续混入训练,可以更好地保留预训练知识并提升机器人泛化能力。 -
RT-2推理
最终效果¶
将互联网知识迁移到了机器人控制,让机器人具备基础语义推理能力。
但是RT-2 从互联网数据中获得的主要是新语义、新物体概念和推理能力,不是新的运动技能。RT-2 论文明确指出,加入互联网数据不会自动产生新的运动方式。机器人动作能力仍然受机器人演示数据覆盖范围限制。