什么是世界模型(World Model)?
世界模型让 AI 在脑中预演未来,学习现实世界的物理规律与交通规则后生成逼真的驾驶场景。本文对比生成式(像素空间预测)与表征式(潜在空间预测)两大流派各自的哲学与优劣。世界模型是解决自动驾驶真实数据稀缺与长尾场景覆盖的核心基础设施。
世界模型让 AI 在脑中预演未来,学习现实世界的物理规律与交通规则后生成逼真的驾驶场景。本文对比生成式(像素空间预测)与表征式(潜在空间预测)两大流派各自的哲学与优劣。世界模型是解决自动驾驶真实数据稀缺与长尾场景覆盖的核心基础设施。
世界模型从预测空间维度可分为像素空间、潜在空间和占用空间三大类别,每种都有不同的代表方法与适用场景。本文系统梳理了 DriveDreamer、GAIA-1、Vista、World4Drive、OccWorld 等主流世界模型,对比其核心技术、条件控制与对规划的支持能力,并给出完整的分类体系与发展脉络。
DriveDreamer 是首个完全从真实驾驶数据构建的自动驾驶世界模型。它用扩散模型配合 ControlNet 机制处理 HDMap、3D 框、文本和动作等多模态结构化条件,通过两阶段训练同时实现可控驾驶视频生成与未来动作预测。作为驾驶世界模型的奠基之作,它开创了从真实场景理解到未来预测的统一范式。