📄 论文信息

  • 标题ST4VLA: Spatially Guided Training for Vision-Language-Action Models
  • 团队:上海人工智能实验室, 香港科技大学, 南方科技大学, 复旦大学
  • arXiv2602.10109
  • 收录:ICLR 2026
  • 关键词:VLA, 空间引导训练, 空间接地, 具身智能, 机器人操作
  • 一句话总结ST4VLA 通过"空间接地预训练 + 空间引导动作训练"双阶段方案,让 VLM 的空间先验显式服务于 VLA 策略学习,在仿真和真实机器人上大幅提升泛化鲁棒性。

ST4VLA 双阶段空间引导训练框架:第一阶段空间接地预训练,第二阶段空间引导动作训练

🤔 要解决什么问题?

VLM 在视觉-语言理解上表现出色,但直接扩展到具身任务时面临根本性挑战:

问题表现原因
空间接地坍塌VLM+动作头的简单拼接导致空间能力退化VLM 的空间先验与策略学习的目标冲突
多模态优化冲突感知目标和动作目标竞争计算资源两者在训练动态上不一致
分布外脆弱性面对新物体/新指令/长时任务性能骤降缺乏可迁移的空间推理能力

💡 核心思想

ST4VLA 的核心洞察是:VLM 本身就具有丰富的空间先验,关键是如何在策略学习中保留并利用这些先验。 方案分为两阶段:

  1. 空间接地预训练(Stage 1):在 VLM 上预训练点、框、轨迹预测任务,注入可迁移的空间先验
  2. 空间引导动作训练(Stage 2):用统一的空间提示激活空间注意力,引导动作生成

⚙️ 方法细节

双系统架构

ST4VLA 采用"VLM Planner + MLP Action Head"的双系统设计:

  • VLM Planner:处理视觉和语言输入,输出空间特征和推理
  • MLP Action Head:将 VLM Planner 的输出映射为具体动作指令

阶段一:空间接地预训练

使用三类空间预测任务从网络数据和机器人数据中学习空间先验:

预测任务输入输出数据来源
点预测图像 + 语言指令目标物体位置点网络级数据
框预测图像 + 语言指令目标边界框网络级数据
轨迹预测图像 + 语言指令完整操作轨迹机器人专有数据

阶段二:空间引导动作训练

动作训练时使用统一的空间提示(Spatial Prompting):

“Figure out how to execute it, then locate the key object needed.”

这个提示虽然简单,但起到了关键作用——它激活了 VLM 中已学到的空间注意力机制,让模型在预测动作前先进行空间推理。消融实验表明,语义提示的有效性远超显式格式约束(如要求输出边界框或坐标点)。

损失函数设计

训练包含两类损失的加权组合:

$$ \mathcal{L} = \mathcal{L}_{action} + \lambda \cdot \mathcal{L}_{grounding} $$

最优比例约 $\lambda = 1:10$(接地损失:动作损失),即动作目标占主导,但保留约 10% 的空间接地监督。

🧪 实验与结果

SimplerEnv 基准

方法Google Robot (VM)WidowX (VM)平均
RT-1-X39.21.120.2
Vanilla VLA66.154.760.4
π₀72.859.366.1
GR00T N1.574.562.168.3
Vanilla Co-training VLA70.358.964.6
ST4VLA84.673.278.9

真实世界评估

在 Franka Research 3 机器人上的真实世界杂乱场景抓取放置任务:

  • 23 个物体 + 5 个容器,1000 条轨迹微调
  • 分布偏移下成功率:92%
  • 对比基线 Vanilla VLA:约 65%

泛化能力

测试场景Vanilla VLAST4VLA提升
已见过物体78.3%91.5%+13.2%
未见物体54.1%82.7%+28.6%
改述指令62.8%85.3%+22.5%
长时任务扰动48.2%76.1%+27.9%

消融实验

配置Google RobotWidowX
Vanilla VLA66.154.7
+ 空间接地预训练79.867.4
+ 空间引导动作训练82.370.9
完整 ST4VLA84.673.2

⚠️ 局限与未来方向

  • ST4VLA 聚焦于机器人操作任务,而非自动驾驶——但空间引导训练的思想对驾驶场景同样有借鉴意义
  • 性能随 VLM 模型规模的增长趋势未充分探索
  • 未报告推理延迟和计算资源消耗,实时部署可行性待验证
  • 失败模式分析不够系统(如 mis-grounding vs. 抓取失败 vs. 轨迹碰撞)

📝 个人思考

ST4VLA 给我的最大启发是 “不要抛弃 VLM 已有的能力”——很多方法在做 VLA 时简单地在 VLM 后面接一个动作头,结果 VLM 的空间理解能力在微调中退化。ST4VLA 通过两阶段方案巧妙地保留了这些先验。

另一个有趣发现是语义提示比格式约束更有效。直觉上,要求模型输出边界框应该更精确,但实际效果反而不好——这可能是因为强制格式化限制了 VLM 的灵活性。统一提示让模型自己决定"怎么理解空间",反而激活了更强的空间推理。

虽然 ST4VLA 主要做机器人,但其"先接地再动作"的思路完全可以迁移到自动驾驶 VLA。驾驶场景中"红绿灯位置"、“车道线空间关系"等空间先验同样需要类似的保护机制。


📖 这是论文精读系列的第 XX 篇。空间引导能否成为 VLA 训练的标准范式?欢迎留言讨论。