论文精读|ST4VLA:空间引导训练实现鲁棒的视觉-语言-动作模型

ST4VLA 提出双阶段空间引导训练框架:第一阶段用点、框、轨迹预测进行空间接地预训练注入空间先验;第二阶段用空间提示引导动作生成。在 SimplerEnv 上 Google Robot 从 66.1 提升到 84.6,WidowX 从 54.7 提升到 73.2,并展现对未见物体和复杂长时任务的强泛化。

2026年7月24日 · 2 分钟 · 274 字 ·