论文精读|NVIDIA Cosmos 3:全模态世界基础模型开启物理AI新纪元

NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构将语言、图像、视频、音频、动作五模态统一进单一世界基础模型。Reasoner 塔负责语义推理,Generator 塔负责高保真生成,两塔通过共享跨模态注意力深度耦合。在 8 项物理 AI 基准上取得开放模型第一,并以 OpenMDW-1.1 宽松许可证开源。

2026年7月19日 · 4 分钟 · 697 字 · 

论文精读|DriveDreamer:构建真实驾驶场景的世界模型

DriveDreamer 是首个完全从真实驾驶数据构建的自动驾驶世界模型。它用扩散模型配合 ControlNet 机制处理 HDMap、3D 框、文本和动作等多模态结构化条件,通过两阶段训练同时实现可控驾驶视频生成与未来动作预测。作为驾驶世界模型的奠基之作,它开创了从真实场景理解到未来预测的统一范式。

2026年7月19日 · 2 分钟 · 329 字 ·