📄 论文信息

OpenVLA 模型架构:基于预训练 VLM 骨干,融合 DINOv2 和 SigLIP 视觉特征,通过动作分词器将机器人控制信号融入语言模型(论文 Figure 1)

  • 标题OpenVLA: An Open-Source Vision-Language-Action Model(OpenVLA:开源视觉-语言-动作模型)
  • 团队:Stanford University、UC Berkeley、Toyota Research Institute、Google DeepMind — Moo Jin Kim、Karl Pertsch、Siddharth Karamcheti、Chelsea Finn、Sergey Levine、Percy Liang 等
  • 发表:arXiv 2406.09246,2024 年 6 月
  • 关键词:VLA、开源、Llama 2、DINOv2、SigLIP、LoRA 微调、机器人操控
  • 一句话总结:首个完全开源的 7B 参数 VLA 模型,以 7 倍更少参数超越闭源 RT-2-X,支持高效微调和量化部署。
  • 论文链接arXiv:2406.09246
  • 代码链接openvla.github.io

🤔 要解决什么问题?

视觉-语言-动作模型(VLA)被认为是机器人通向通用智能的关键路径。这类模型将预训练的视觉-语言模型(VLM)直接微调为机器人控制策略,能够利用互联网规模的视觉-语言先验来提升泛化能力。

然而,VLA 模型的广泛应用面临两大障碍:

1. 现有 VLA 模型几乎全部闭源

RT-2(55B 参数)虽然展示了惊人的泛化能力,但它是闭源的——不公开模型权重、训练代码或数据混合。这意味着:

  • 研究社区无法复现或改进
  • 其他实验室无法在其基础上构建
  • VLA 研究变成了"军备竞赛"而非开放合作

2. 缺乏高效微调的最佳实践

即使有开源的通用策略(如 Octo),如何高效地将其适配到新机器人、新任务仍是未解问题。现有工作:

  • 没有系统研究 LoRA 等参数高效微调方法在 VLA 上的效果
  • 没有探索模型量化对 VLA 推理的影响
  • 缺乏面向消费级硬件的部署方案

核心问题

如何构建一个开源、高效、可微调的 VLA 模型,使其性能达到或超越闭源模型,同时让机器人研究社区能够自由使用和改进?

OpenVLA 的回答是:基于开源 VLM 骨干 + 机器人数据微调 + 参数高效适配


💡 核心方法

模型架构:端到端 VLA

OpenVLA 的核心创新是直接微调预训练 VLM 生成机器人动作,而非像 Octo 那样将视觉编码器和语言模型分开处理。

视觉编码器:DINOv2 + SigLIP 双流融合

OpenVLA 使用两个互补的预训练视觉编码器:

编码器特点提供的能力
DINOv2自监督训练,关注空间结构低层次几何信息、物体边界、空间关系
SigLIP监督训练,关注语义理解高层次语义信息、物体识别、场景理解

两个编码器的特征通过 patch-as-token 方式融合:

  • 图像被分成 $16 \times 16$ 的 patch
  • 每个 patch 同时提取 DINOv2 和 SigLIP 特征
  • 拼接后投影到语言模型的输入空间

这种双流设计使得 OpenVLA 能够同时理解"在哪里"(空间)和"是什么"(语义)。

语言骨干:Llama 2

使用 Llama 2 7B 作为语言模型骨干,这是一个在互联网规模文本上预训练的强大语言模型。选择 Llama 2 的原因:

  • 开源且广泛使用
  • 强大的指令遵循和推理能力
  • 成熟的微调生态(LoRA、量化等)

动作输出:离散化 token 预测

与 Octo 使用扩散头不同,OpenVLA 将连续动作离散化为 token

  • 将每个动作维度的范围均匀分成 256 个 bin
  • 每个动作维度映射为一个离散 token
  • 语言模型自回归地预测这些动作 token

这种方法的优势:

  • 可以直接复用语言模型的自回归生成框架
  • 不需要额外的动作解码器
  • 训练简单,损失函数就是标准的交叉熵

劣势:

  • 精度受 bin 数量限制
  • 自回归生成速度较慢

训练数据:Open X-Embodiment 精选

OpenVLA 在 97 万条真实机器人演示轨迹上训练,这些数据来自 Open X-Embodiment 数据集的精选子集:

  • 来源:21 种不同机器人平台
  • 任务类型:物体操控、桌面整理、工具使用等
  • 数据筛选:过滤低质量轨迹,平衡不同来源的数据比例

关键的数据处理策略:

  1. 动作归一化:对每个动作维度进行标准化
  2. 图像增强:随机裁剪、颜色抖动等
  3. 语言标注清洗:使用语言模型验证指令质量

参数高效微调:LoRA

OpenVLA 首次系统研究了 LoRA(Low-Rank Adaptation) 在 VLA 模型上的效果:

  • 在 Transformer 层的注意力矩阵中添加低秩适配层
  • 微调时只更新 LoRA 参数,冻结原始模型权重
  • 可以将微调参数量从 7B 降低到约 数十 MB

实验表明,LoRA 微调的 OpenVLA 在大多数任务上能达到全参数微调的效果,但计算成本大幅降低。

量化推理:INT4/INT8

为了在消费级硬件上部署,OpenVLA 探索了模型量化:

  • INT8 量化:几乎不影响性能,内存减少约 50%
  • INT4 量化:轻微性能下降,但内存减少约 75%
  • 支持在单张消费级 GPU 上实时推理

🧪 实验验证

直接评估:超越闭源模型

OpenVLA 在多个机器人平台上的评估结果,以 7 倍更少参数超越 RT-2-X(论文 Figure 2)

在 WidowX 和 Google Robot 两个平台上评估 29 个任务:

模型参数量平均成功率
RT-2 (PaLI-X)55B62.3%
OpenVLA7B78.8%
Octo93M52.1%
从零训练 Diffusion Policy-45.6%

关键发现:

  • OpenVLA 以 7 倍更少的参数 超越 RT-2-X 16.5% 的绝对成功率
  • 这得益于更好的数据多样性和双视觉编码器设计
  • 开源模型首次在 VLA 领域达到 SOTA

微调实验:高效适配新平台

在 Franka 机器人上评估微调效果,涉及 7 个操控任务:

OpenVLA 微调实验结果,LoRA 微调接近全参数微调效果(论文 Figure 3)

方法单任务多任务语言泛化
从零训练 Diffusion Policy62.3%41.2%28.5%
Octo 微调68.7%52.8%45.2%
OpenVLA 全参数微调85.4%71.6%68.3%
OpenVLA LoRA 微调83.2%69.5%65.7%

关键发现:

  • OpenVLA 微调显著优于从零训练(+23.1%)和 Octo 微调(+16.7%)
  • LoRA 微调仅用 1% 的参数即可达到全参数微调 97% 的效果
  • 在多任务和语言泛化场景下优势更明显

LoRA 微调消融

系统研究 LoRA 的秩(rank)对性能的影响:

LoRA Rank可训练参数成功率相对全参数
42.3M76.8%89.9%
168.9M80.2%93.9%
6434.8M82.5%96.6%
全参数7B85.4%100%

发现:rank=64 是性能-效率的最佳平衡点,用不到 0.5% 的参数达到 97% 的性能。

量化推理评估

量化方式内存占用推理延迟成功率
FP1614GB85ms83.2%
INT87GB62ms82.8%
INT44GB48ms81.5%

INT8 量化几乎不影响性能,但内存和延迟都显著降低。


🔍 个人思考

亮点

  1. 开源生态的里程碑:OpenVLA 是第一个在性能上超越闭源 SOTA 的开源 VLA 模型。这不仅是一个技术突破,更是对机器人研究生态的重要贡献——它让全球研究者都能在统一的基线上竞争和合作。

  2. 双视觉编码器的巧妙设计:DINOv2(空间)+ SigLIP(语义)的组合非常优雅,解决了单一视觉编码器难以同时捕获空间和语义信息的问题。这种设计思路可以推广到更多多模态任务。

  3. 工程实用性极强:LoRA 微调 + INT8 量化使得 OpenVLA 可以在单张消费级 GPU 上运行,这对于资源有限的实验室和初创公司极具吸引力。

  4. 系统性消融研究:论文不仅报告了 SOTA 结果,还系统研究了数据混合、视觉编码器选择、微调策略等关键决策,为后续工作提供了宝贵的工程指南。

局限性

  1. 离散化动作的精度瓶颈:将连续动作离散化为 256 个 bin 虽然简化了训练,但引入了不可逆的精度损失。对于需要精细力控或高速运动的任务,这可能成为瓶颈。

  2. 自回归生成速度慢:动作 token 需要逐个生成,对于高频控制(>20Hz)可能不够快。相比之下,扩散头可以并行生成整个动作序列。

  3. 数据规模仍有限:97 万条轨迹虽然已经很大,但与互联网规模的视觉-语言数据(数十亿)相比仍相差甚远。这限制了模型的泛化上限。

  4. 缺少触觉和力觉:纯视觉输入难以处理需要力反馈的任务(如插入、拧紧)。多模态感知的融合是未来的必要方向。

未来方向

  1. 从离散到连续:将动作头从离散 token 预测改为连续输出(如 Flow Matching 或扩散模型),可以同时提升精度和速度。π0 等后续工作已经验证了这条路线。

  2. 规模扩展:将模型从 7B 扩展到 13B、70B,结合更大规模的数据,有望实现真正的零样本泛化。

  3. 多模态感知融合:加入触觉、力觉、听觉等模态,使机器人能够更全面地感知物理世界。

  4. 在线学习与自我改进:结合强化学习或在线学习机制,使模型能够在部署后从自身经验中学习和改进。


📖 延伸阅读