论文精读|ST4VLA:空间引导训练实现鲁棒的视觉-语言-动作模型
ST4VLA 提出双阶段空间引导训练框架:第一阶段用点、框、轨迹预测进行空间接地预训练注入空间先验;第二阶段用空间提示引导动作生成。在 SimplerEnv 上 Google Robot 从 66.1 提升到 84.6,WidowX 从 54.7 提升到 73.2,并展现对未见物体和复杂长时任务的强泛化。
ST4VLA 提出双阶段空间引导训练框架:第一阶段用点、框、轨迹预测进行空间接地预训练注入空间先验;第二阶段用空间提示引导动作生成。在 SimplerEnv 上 Google Robot 从 66.1 提升到 84.6,WidowX 从 54.7 提升到 73.2,并展现对未见物体和复杂长时任务的强泛化。
DLWM 提出双阶段自监督预训练范式:第一阶段用多视图语义和深度重建学习 3D 高斯场景表示;第二阶段训练双潜在世界模型——高斯流引导的潜在预测(占据感知/预测)和自车规划引导的潜在预测(运动规划)。在 nuScenes 上占据预测 +1.02 mIoU,规划 L2 误差降低 16%。