📄 论文信息
- 标题:ST4VLA: Spatially Guided Training for Vision-Language-Action Models
- 团队:上海人工智能实验室, 香港科技大学, 南方科技大学, 复旦大学
- arXiv:2602.10109
- 收录:ICLR 2026
- 关键词:VLA, 空间引导训练, 空间接地, 具身智能, 机器人操作
- 一句话总结:ST4VLA 通过"空间接地预训练 + 空间引导动作训练"双阶段方案,让 VLM 的空间先验显式服务于 VLA 策略学习,在仿真和真实机器人上大幅提升泛化鲁棒性。

🤔 要解决什么问题?
VLM 在视觉-语言理解上表现出色,但直接扩展到具身任务时面临根本性挑战:
| 问题 | 表现 | 原因 |
|---|---|---|
| 空间接地坍塌 | VLM+动作头的简单拼接导致空间能力退化 | VLM 的空间先验与策略学习的目标冲突 |
| 多模态优化冲突 | 感知目标和动作目标竞争计算资源 | 两者在训练动态上不一致 |
| 分布外脆弱性 | 面对新物体/新指令/长时任务性能骤降 | 缺乏可迁移的空间推理能力 |
💡 核心思想
ST4VLA 的核心洞察是:VLM 本身就具有丰富的空间先验,关键是如何在策略学习中保留并利用这些先验。 方案分为两阶段:
- 空间接地预训练(Stage 1):在 VLM 上预训练点、框、轨迹预测任务,注入可迁移的空间先验
- 空间引导动作训练(Stage 2):用统一的空间提示激活空间注意力,引导动作生成
⚙️ 方法细节
双系统架构
ST4VLA 采用"VLM Planner + MLP Action Head"的双系统设计:
- VLM Planner:处理视觉和语言输入,输出空间特征和推理
- MLP Action Head:将 VLM Planner 的输出映射为具体动作指令
阶段一:空间接地预训练
使用三类空间预测任务从网络数据和机器人数据中学习空间先验:
| 预测任务 | 输入 | 输出 | 数据来源 |
|---|---|---|---|
| 点预测 | 图像 + 语言指令 | 目标物体位置点 | 网络级数据 |
| 框预测 | 图像 + 语言指令 | 目标边界框 | 网络级数据 |
| 轨迹预测 | 图像 + 语言指令 | 完整操作轨迹 | 机器人专有数据 |
阶段二:空间引导动作训练
动作训练时使用统一的空间提示(Spatial Prompting):
“Figure out how to execute it, then locate the key object needed.”
这个提示虽然简单,但起到了关键作用——它激活了 VLM 中已学到的空间注意力机制,让模型在预测动作前先进行空间推理。消融实验表明,语义提示的有效性远超显式格式约束(如要求输出边界框或坐标点)。
损失函数设计
训练包含两类损失的加权组合:
$$ \mathcal{L} = \mathcal{L}_{action} + \lambda \cdot \mathcal{L}_{grounding} $$最优比例约 $\lambda = 1:10$(接地损失:动作损失),即动作目标占主导,但保留约 10% 的空间接地监督。
🧪 实验与结果
SimplerEnv 基准
| 方法 | Google Robot (VM) | WidowX (VM) | 平均 |
|---|---|---|---|
| RT-1-X | 39.2 | 1.1 | 20.2 |
| Vanilla VLA | 66.1 | 54.7 | 60.4 |
| π₀ | 72.8 | 59.3 | 66.1 |
| GR00T N1.5 | 74.5 | 62.1 | 68.3 |
| Vanilla Co-training VLA | 70.3 | 58.9 | 64.6 |
| ST4VLA | 84.6 | 73.2 | 78.9 |
真实世界评估
在 Franka Research 3 机器人上的真实世界杂乱场景抓取放置任务:
- 23 个物体 + 5 个容器,1000 条轨迹微调
- 分布偏移下成功率:92%
- 对比基线 Vanilla VLA:约 65%
泛化能力
| 测试场景 | Vanilla VLA | ST4VLA | 提升 |
|---|---|---|---|
| 已见过物体 | 78.3% | 91.5% | +13.2% |
| 未见物体 | 54.1% | 82.7% | +28.6% |
| 改述指令 | 62.8% | 85.3% | +22.5% |
| 长时任务扰动 | 48.2% | 76.1% | +27.9% |
消融实验
| 配置 | Google Robot | WidowX |
|---|---|---|
| Vanilla VLA | 66.1 | 54.7 |
| + 空间接地预训练 | 79.8 | 67.4 |
| + 空间引导动作训练 | 82.3 | 70.9 |
| 完整 ST4VLA | 84.6 | 73.2 |
⚠️ 局限与未来方向
- ST4VLA 聚焦于机器人操作任务,而非自动驾驶——但空间引导训练的思想对驾驶场景同样有借鉴意义
- 性能随 VLM 模型规模的增长趋势未充分探索
- 未报告推理延迟和计算资源消耗,实时部署可行性待验证
- 失败模式分析不够系统(如 mis-grounding vs. 抓取失败 vs. 轨迹碰撞)
📝 个人思考
ST4VLA 给我的最大启发是 “不要抛弃 VLM 已有的能力”——很多方法在做 VLA 时简单地在 VLM 后面接一个动作头,结果 VLM 的空间理解能力在微调中退化。ST4VLA 通过两阶段方案巧妙地保留了这些先验。
另一个有趣发现是语义提示比格式约束更有效。直觉上,要求模型输出边界框应该更精确,但实际效果反而不好——这可能是因为强制格式化限制了 VLM 的灵活性。统一提示让模型自己决定"怎么理解空间",反而激活了更强的空间推理。
虽然 ST4VLA 主要做机器人,但其"先接地再动作"的思路完全可以迁移到自动驾驶 VLA。驾驶场景中"红绿灯位置"、“车道线空间关系"等空间先验同样需要类似的保护机制。
📖 这是论文精读系列的第 XX 篇。空间引导能否成为 VLA 训练的标准范式?欢迎留言讨论。