论文精读|具身智能VLA模型综述:从视觉-语言到动作生成的技术全景

首篇系统性综述视觉-语言-动作(VLA)模型的文章,从组件、控制策略和任务规划三个维度全面梳理了VLA模型的技术脉络,涵盖CLIP/R3M/DINOv2等视觉表征、RT-1/RT-2/OpenVLA等控制策略、SayCan/Code as Policies等任务规划方法,并深入探讨了安全、数据集、基础模型等挑战与未来方向。

2026年7月28日 · 3 分钟 · 480 字 ·