📄 论文信息
- 标题:Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms
- 团队:北京大学, 新加坡国立大学, Monash 大学
- arXiv:2604.23775(CC BY 4.0)
- 关键词:VLA 安全, 对抗攻击, 防御机制, 具身 AI 安全
- 一句话总结:首篇系统性 VLA 安全综述,沿攻击/防御双时间轴整理了数据投毒、对抗攻击、语义越狱等 10+ 类威胁及其防御方案,指出具身特性(物理后果、多模态攻击面、实时延迟约束)使 VLA 安全远复杂于传统 LLM 安全。

🤔 为什么要关注 VLA 安全?
VLA 模型正从实验室走向真实部署,其具身特性带来了全新的安全挑战:
| 安全维度 | VLA 特有挑战 | 传统 LLM 安全对比 |
|---|---|---|
| 物理后果 | 动作直接影响物理世界 | 仅限于数字内容 |
| 多模态攻击面 | 视觉+语言+状态三通道 | 主要是文本 |
| 实时约束 | 防御必须在毫秒级完成 | 宽松延迟容忍 |
| 错误传播 | 长时程轨迹中错误累积 | 相对独立 |
| 数据供应链 | 机器人数据收集过程易被污染 | 数据来源相对可控 |
📋 综述框架
该综述以两条平行的时间轴组织整个领域:
攻击时机
训练时攻击:
- 数据投毒(Data Poisoning):在训练数据中注入恶意样本
- 后门攻击(Backdoor Attacks):植入特定触发器,推理时激活恶意行为
推理时攻击:
- 对抗补丁(Adversarial Patches):在物理世界中贴对抗图案
- 跨模态扰动(Cross-modal Perturbations):同时干扰视觉和语言输入
- 语义越狱(Semantic Jailbreaks):用语义层面的对抗提示绕过安全约束
- 冻结攻击(Freezing Attacks):让模型进入"不作为"状态
防御时机
训练时防御:
- 数据清洗与验证
- 对抗训练
- 安全感知的 RLHF
推理时防御:
- 输入检测与过滤
- 运行时监控
- 鲁棒推理
评估基准
综述整理了现有 VLA 安全评估基准和指标:
| 基准 | 领域 | 评估维度 |
|---|---|---|
| DriveLM-Safety | 自动驾驶 | 对抗场景下的 QA 准确性 |
| CARLA-Security | 自动驾驶 | 物理对抗攻击成功率 |
| RobotSafetyBench | 机器人 | 操作安全与异常检测 |
| EmbodiedAttackSuite | 通用具身 | 跨模态攻击效果 |
🎯 六大部署领域的安全挑战
综述涵盖 6 个具体部署场景:
- 自动驾驶:对抗补丁导致错误转向/刹车决策
- 服务机器人:语义越狱导致危险操作
- 工业机器人:数据投毒导致生产事故
- 医疗机器人:跨模态扰动导致手术偏差
- 无人机:冻结攻击导致坠毁
- 家庭机器人:隐私泄露与物理安全
🔑 关键发现
- 多视角优化比单帧攻击更有效:在自动驾驶的 6 相机设置中,同时攻击所有视角比单独攻击某一视角的迁移性高 30%+
- 特征空间目标提升黑盒迁移:基于特征空间的对抗目标比基于标签的目标在黑盒场景下攻击成功率高 15-20%
- 文字内容嵌入图像是持久漏洞:相机图像中的印刷文字(路牌、广告牌)被替换时,VLA 模型几乎无法防御
- 推理时防御面临实时性瓶颈:现有检测方法在自动驾驶要求的 <50ms 延迟内难以完成
⚠️ 开放问题
综述强调的几个关键未解决问题:
- 具身轨迹的认证鲁棒性(Certified Robustness):现有认证方法主要针对图像分类,无法扩展到长时程动作序列
- 物理可实现的防御(Physically Realizable Defenses):理论安全的防御方案在物理世界中往往失效
- 安全感知训练(Safety-Aware Training):如何将安全约束系统性地融入 VLA 训练
- 统一运行时安全架构:缺少端到端的 VLA 安全监控系统
- 标准化评估:不同领域的评估基准高度碎片化
📝 个人思考
这篇综述的价值在于它把分散在机器人、对抗机器学习、AI Alignment、自动驾驶安全四个社区的工作第一次统一到了一个框架下。对于从事 VLA 研究的同学来说,这是一份"安全必读清单"——在做 VLA 模型设计时就应考虑这些威胁,而非事后补丁。
最让我警觉的是**“文字内容嵌入图像"的漏洞**。在自动驾驶中,路牌、广告牌上的文字可以被恶意替换成对抗性内容,而目前的 VLA 模型几乎无法防御。这意味着 VLA 不仅需要视觉鲁棒性,还需要语义级的鲁棒性。
值得注意的是,这篇综述与我们的论文精读系列有很好的互补——我们读了这么多 VLA 架构论文,但几乎没有一篇深入讨论安全问题。安全是 VLA 从 Demo 走向部署的最后一道门槛。
📖 这是论文精读系列的第 XX 篇。VLA 能力越强,安全责任越大。欢迎留言讨论。