论文精读|EMMA:Waymo的多模态端到端驾驶大模型

Waymo 的 EMMA 基于 Gemini 多模态大模型,把所有驾驶任务(感知、预测、规划)统一翻译成自然语言 VQA,用单一模型、一套语言空间端到端处理。它选择直接文本化坐标以最大化复用 Gemini 预训练的世界知识。代表了将 MLLM 作为驾驶系统’一等公民’的前沿探索。

2026年7月19日 · 3 分钟 · 486 字 · 

知识点拆解|VLM 视觉语言模型入门详解:从 CLIP 到 GPT-4V

VLM(视觉语言模型)是 VLA 的视觉理解基础。本文从 CLIP 奠基到 GPT-4V/Gemini 前沿,系统梳理架构演进(ViT → Q-Former → LLM)、训练三阶段(对齐→指令微调→RLHF)及驾驶 VLM 的适配方案。

2026年7月19日 · 4 分钟 · 737 字 ·