论文精读|OpenVLA:开源视觉-语言-动作模型——VLA走向开放生态

OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型,在 97 万条真实机器人演示上训练,以 7 倍更少的参数超越闭源模型 RT-2-X(55B)。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干,结合 LoRA 微调和量化推理,OpenVLA 让 VLA 模型首次走向开放生态。

2026年7月28日 · 3 分钟 · 432 字 · 

论文精读|具身智能VLA模型综述:从视觉-语言到动作生成的技术全景

首篇系统性综述视觉-语言-动作(VLA)模型的文章,从组件、控制策略和任务规划三个维度全面梳理了VLA模型的技术脉络,涵盖CLIP/R3M/DINOv2等视觉表征、RT-1/RT-2/OpenVLA等控制策略、SayCan/Code as Policies等任务规划方法,并深入探讨了安全、数据集、基础模型等挑战与未来方向。

2026年7月28日 · 3 分钟 · 480 字 ·