论文精读|ST4VLA:空间引导训练实现鲁棒的视觉-语言-动作模型

ST4VLA 提出双阶段空间引导训练框架:第一阶段用点、框、轨迹预测进行空间接地预训练注入空间先验;第二阶段用空间提示引导动作生成。在 SimplerEnv 上 Google Robot 从 66.1 提升到 84.6,WidowX 从 54.7 提升到 73.2,并展现对未见物体和复杂长时任务的强泛化。

2026年7月24日 · 2 分钟 · 274 字 · 

论文精读|DLWM:双潜在世界模型实现高斯中心的全方位预训练

DLWM 提出双阶段自监督预训练范式:第一阶段用多视图语义和深度重建学习 3D 高斯场景表示;第二阶段训练双潜在世界模型——高斯流引导的潜在预测(占据感知/预测)和自车规划引导的潜在预测(运动规划)。在 nuScenes 上占据预测 +1.02 mIoU,规划 L2 误差降低 16%。

2026年7月24日 · 2 分钟 · 266 字 ·