📄 论文信息

PaLM-E Teaser

  • 标题PaLM-E: An Embodied Multimodal Language Model(PaLM-E:具身多模态语言模型)
  • 团队:Google Robotics at Google + 柏林工业大学(Danny Driess, Fei Xia, Corey Lynch, Sergey Levine, Karol Hausman, Pete Florence 等22位作者)
  • 发表:ICML 2023(arXiv 2023.03)
  • 关键词:多模态大语言模型、具身智能、视觉语言模型、机器人规划、跨模态迁移
  • 一句话总结:PaLM-E将大语言模型直接与连续传感器输入结合,构建了一个能同时处理机器人规划、视觉问答、图像描述等多种任务的通用具身多模态模型,最大规模达562B参数。
  • 论文链接arXiv:2303.03378
  • 代码链接palm-e(非官方实现)

🤔 要解决什么问题?

语言模型的"具身接地"挑战

大型语言模型(LLM)在文本理解和生成方面展现了惊人的能力,但在将其应用于机器人等物理世界任务时,面临一个核心挑战:接地(Grounding)问题

这个问题的本质在于:LLM的知识是通过文本获得的,它"知道"如何清洁溢出的饮料,但这种知识是抽象的、脱离物理现实的。当一个机器人需要在真实环境中执行这个任务时,它面临多重挑战:

  1. 理解当前环境状态:哪些物体在哪里?它们的物理属性是什么?颜色、形状、材质如何?
  2. 感知连续传感器数据:机器人配备的是图像、深度图、关节角度、力传感器等连续信号,而非文本描述
  3. 将抽象知识与具体感知关联:LLM说"拿起海绵",但机器人需要"看到"海绵在哪里、判断能否抓取、规划运动轨迹
  4. 处理物理世界的不确定性:物体可能滑动、传感器可能有噪声、环境可能动态变化

传统方法(如SayCan)通过将LLM的输出与低级技能库结合来解决这个问题。在SayCan框架中,LLM负责理解指令并选择合适的技能,而affordance函数负责评估技能的可行性。但这种方式存在明显局限:

  • 需要预先定义技能库:技能库的覆盖范围决定了系统能力的上限
  • LLM只能输出文本:它无法直接感知环境,需要额外的"翻译层"将文本映射到动作
  • 信息传递有损失:从文本到动作的多次转换会引入信息损失
  • 缺乏端到端优化:各模块独立训练,无法联合优化

此前的视觉语言模型(VLM)如CLIP、Flamingo等虽然能处理图像和文本,但它们主要针对互联网上的静态图像设计,缺乏对机器人操作场景的理解。这些模型"看到"的是高质量的互联网图片,而非机器人视角的实时传感器数据。

PaLM-E的核心问题

能否让大语言模型直接"看到"和"感受"物理世界,从而构建一个真正意义上的具身智能体?

具体来说:

  1. 能否将连续传感器数据(图像、状态估计等)直接输入LLM?
  2. 训练这样一个模型是否会导致灾难性遗忘(catastrophic forgetting)?
  3. 多任务、多模态、多机器人的联合训练是否能带来正向迁移?

💡 核心方法

核心思想:将连续感知注入语言嵌入空间

PaLM-E的核心架构思想非常优雅:将连续的具身观测(图像、状态估计等)编码为与语言token相同维度的向量,然后将这些"具身token"与文本token交错排列,形成"多模态句子"(multimodal sentences)作为LLM的输入。

PaLM-E Architecture

模型架构

1. 整体架构

PaLM-E是一个decoder-only的自回归语言模型,基于预训练的PaLM构建。其输入是文本和连续观测的交错序列:

$$\text{Input} = [\text{text}_1, \text{text}_2, ..., \text{obs}_1, \text{obs}_2, ..., \text{text}_3, ...]$$

其中 $\text{obs}_i$ 可以是图像、机器人状态、或神经场景表示等任意模态的连续输入。模型的输出是文本序列,可以是对问题的回答、图像描述、或机器人动作序列。

2. 多模态编码器

PaLM-E支持三种主要的连续输入表示方式:

(a)视觉输入(ViT编码器)

使用预训练的Vision Transformer(ViT)将图像编码为一系列视觉token:

$$\text{visual\_tokens} = \text{ViT}(I) \in \mathbb{R}^{N_v \times d}$$

其中 $N_v$ 是视觉token数量,$d$ 是嵌入维度(与PaLM的token嵌入维度匹配)。

(b)状态估计输入

对于机器人关节状态等低维连续信号,使用多层感知机(MLP)将其编码为token:

$$\text{state\_token} = \text{MLP}(s) \in \mathbb{R}^{1 \times d}$$

其中 $s \in \mathbb{R}^{d_s}$ 是机器人状态向量。

(c)神经场景表示(OSRT)

PaLM-E引入了一种创新的输入表示——神经场景表示。使用Object-Centric Neural Radiance Field(OSRT)将场景中的物体表示为3D神经场:

$$\text{scene\_token} = \text{OSRT}(\mathcal{O}) \in \mathbb{R}^{N_o \times d}$$

其中 $\mathcal{O}$ 是场景中的物体集合。这种表示的优势在于:

  • 提供3D空间信息,不受相机视角影响
  • 支持物体级别的操作和推理
  • 在小数据场景下特别有效

3. 多模态句子构造

将编码后的连续token与文本token交错排列,形成多模态句子:

$$\text{MM-Sentence} = [\text{< img>}, t_1, t_2, ..., \text{< img>}, t_3, t_4, ..., \text{text}]$$

其中 <img> 是特殊的多模态token标记,用于分隔不同的模态输入。论文还提出了**实体标注(entity-labeling)**技术,为每个模态输入添加语义标签(如"red star"、“green block”),增强模型对物体的理解。

4. 训练策略

PaLM-E采用端到端微调策略,损失函数为标准的自回归语言建模损失:

$$\mathcal{L} = -\sum_{i=1}^{T} \log p_\theta(x_i | x_{1:i-1})$$

其中序列 $x$ 包含文本和连续观测的混合。训练使用多种数据集的混合:

  • 机器人任务数据(TAMP、Language-Table、SayCan)
  • 通用视觉语言数据(WebLI、VQA、COCO等)

关键设计决策

冻结 vs. 微调 LLM

论文系统研究了冻结(freeze)vs. 微调(finetune)语言模型的影响:

策略优势劣势
冻结LLM完全保留语言能力视觉-语言对齐受限
微调LLM更好的多模态融合可能发生灾难性遗忘
仅微调ViT平衡点需要更多数据

实验发现:随着模型规模增大,微调导致的灾难性遗忘显著减少。对于PaLM-E-562B,仅3.9%的语言能力下降(而PaLM-E-12B下降了87.3%)。

数据混合与正向迁移

PaLM-E的核心发现之一是正向迁移(positive transfer):在多种任务和数据集上联合训练,每个任务的性能反而比单独训练更高。

例如,在TAMP(Task and Motion Planning)环境中:

  • 仅用TAMP数据训练:60%成功率
  • 用完整数据混合训练:95%成功率

这种正向迁移来自:

  1. 视觉语言数据提供了丰富的视觉和语义理解
  2. 多机器人数据提供了更泛化的操作技能
  3. 语言数据帮助模型更好地理解指令

🧪 实验验证

实验设计

PaLM-E在三大类任务上进行了评估:

  1. 具身推理任务:机器人规划、操作
  2. 视觉语言任务:VQA、图像描述
  3. 语言任务:自然语言理解与生成

核心实验结果

1. 机器人规划任务(TAMP)

在TAMP环境中,给定自然语言指令和场景图像,模型需要输出多步操作计划:

模型成功率
PaLM-E-12B(冻结)42.9%
PaLM-E-12B(微调,单机器人)48.6%
PaLM-E-12B(微调,完整混合)94.9%

正向迁移的效果极其显著:完整数据混合训练将成功率从48.6%提升到94.9%。

2. Language-Table任务

在桌面操作环境中,模型需要根据语言指令规划积木操作:

  • PaLM-E在32-shot数据下就能达到85%+的成功率
  • 冻结LLM的策略也能取得不错的结果(74.3%)
  • 完整数据混合训练显著提升性能

3. SayCan affordance任务

在真实厨房环境中,PaLM-E需要为SayCan框架提供affordance评分:

  • PaLM-E显著优于专用affordance模型
  • 视觉语言预训练提供了更好的环境理解

4. 视觉语言基准

PaLM-E在通用VQA任务上同样表现出色:

任务PaLM-E-562B最优参考
OK-VQA66.1%(32-shot)64.7%
VQAv251.1%(冻结LLM)51.0%
VizWiz55.4%(冻结LLM)55.7%

PaLM-E-562B在OK-VQA上达到了当时的SOTA,证明了具身训练不会损害通用视觉语言能力。

5. 语言能力保留

论文系统评估了PaLM-E在21个语言基准上的表现,发现:

  • PaLM-E-8B:87.3%的语言能力下降(灾难性遗忘严重)
  • PaLM-E-12B:61.6%下降
  • PaLM-E-62B:31.8%下降
  • PaLM-E-562B:仅3.9%下降

这表明模型规模越大,微调导致的灾难性遗忘越少,为"冻结LLM vs. 微调LLM"的争论提供了重要参考。

6. 涌现能力

PaLM-E-562B展示了多种涌现能力:

  • 零样本多模态链式思维(CoT)推理:无需示例即可进行复杂推理
  • 视觉条件化笑话生成:根据图像生成幽默内容
  • 跨模态问答:理解图像并回答相关问题

🔍 个人思考

亮点

  1. 架构设计的优雅性:PaLM-E将连续感知直接注入语言token空间,这种方法既简单又强大。不需要复杂的"翻译层",模型自然地学会了将视觉信息与语言理解关联。

  2. 正向迁移的发现:这是本文最重要的贡献之一。联合训练多种任务(机器人+VQA+描述)不仅没有互相干扰,反而产生了显著的性能提升。这为"数据越多越好"的假设提供了实证支持。

  3. 模型规模与遗忘的关系:论文系统研究了模型规模与灾难性遗忘的关系,发现562B模型几乎不受影响。这一发现对后续的多模态大模型训练具有重要指导意义。

  4. 神经场景表示的引入:OSRT作为输入表示是一个创新点,它提供了3D空间信息,在小数据场景下特别有效。这为机器人感知提供了新的范式。

  5. 多模态涌现能力:PaLM-E-562B展示了零样本CoT推理等涌现能力,表明具身训练不仅不会损害通用能力,反而可能增强某些能力。

局限性

  1. 计算成本极高:PaLM-E-562B需要巨大的计算资源进行训练和推理,这限制了其在实际机器人系统中的部署。即使是12B版本也需要相当的计算能力。

  2. 闭环控制的缺失:PaLM-E主要作为一个规划器(planner),输出的是自然语言动作序列而非直接的低级控制命令。它需要与RT-1等低级策略集成才能完成完整的闭环控制。

  3. 推理延迟:大模型的推理延迟较高,对于需要快速反应的机器人任务来说是个挑战。论文中3Hz的控制频率对于精细操作可能不够。

  4. 数据需求:虽然论文展示了正向迁移,但PaLM-E的训练仍然需要大量多样化的数据。对于资源有限的团队来说,复现这一工作极具挑战性。

  5. 对预训练模型的依赖:PaLM-E完全基于预训练的PaLM,如果基础语言模型本身存在偏见或错误知识,这些也会被传递到具身任务中。

未来方向

  1. 与RT-2的结合:PaLM-E的后续工作RT-2(Brohan et al., 2023)将VLM直接用于机器人控制,实现了端到端的视觉语言动作(VLA)模型。

  2. 更高效的架构:探索如何在保持性能的同时减小模型规模,使其能够在机器人硬件上实时运行。

  3. 实时闭环控制:将PaLM-E扩展为能够输出低级控制命令的闭环策略,而非仅作为高层规划器。

  4. 多形态机器人:扩展到更多类型的机器人(如灵巧手、人形机器人),探索真正的跨形态迁移。

  5. 在线学习:让PaLM-E能够在部署后从新经验中学习,持续改进其具身理解能力。


📖 延伸阅读

  1. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(Brohan et al., 2023)- PaLM-E思想的直接延续,将VLM用于机器人控制
  2. PaLM: Scaling Language Modeling with Pathways(Chowdhery et al., 2022)- PaLM-E的基础语言模型
  3. ViT: An Image is Worth 16x16 Words(Dosovitskiy et al., 2020)- PaLM-E使用的视觉编码器
  4. Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language(Zeng et al., 2022)- 相关的多模态推理方法
  5. Inner Monologue: Embodied Reasoning through Planning with Language Models(Huang et al., 2022)- 基于PaLM-E的闭环规划扩展
  6. Do As I Can, Not As I Say: Grounding Language in Robotic Affordances(Ahn et al., 2022)- SayCan工作,PaLM-E的前身思想
  7. OSRT: Object-Centric Neural Scene Representations(Sajjadi et al., 2022)- PaLM-E使用的神经场景表示