论文精读|OpenVLA:开源视觉-语言-动作模型——VLA走向开放生态
OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型,在 97 万条真实机器人演示上训练,以 7 倍更少的参数超越闭源模型 RT-2-X(55B)。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干,结合 LoRA 微调和量化推理,OpenVLA 让 VLA 模型首次走向开放生态。
OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型,在 97 万条真实机器人演示上训练,以 7 倍更少的参数超越闭源模型 RT-2-X(55B)。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干,结合 LoRA 微调和量化推理,OpenVLA 让 VLA 模型首次走向开放生态。
首篇系统性综述视觉-语言-动作(VLA)模型的文章,从组件、控制策略和任务规划三个维度全面梳理了VLA模型的技术脉络,涵盖CLIP/R3M/DINOv2等视觉表征、RT-1/RT-2/OpenVLA等控制策略、SayCan/Code as Policies等任务规划方法,并深入探讨了安全、数据集、基础模型等挑战与未来方向。