论文精读|NVIDIA Cosmos 3:全模态世界基础模型开启物理AI新纪元
NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构将语言、图像、视频、音频、动作五模态统一进单一世界基础模型。Reasoner 塔负责语义推理,Generator 塔负责高保真生成,两塔通过共享跨模态注意力深度耦合。在 8 项物理 AI 基准上取得开放模型第一,并以 OpenMDW-1.1 宽松许可证开源。
NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构将语言、图像、视频、音频、动作五模态统一进单一世界基础模型。Reasoner 塔负责语义推理,Generator 塔负责高保真生成,两塔通过共享跨模态注意力深度耦合。在 8 项物理 AI 基准上取得开放模型第一,并以 OpenMDW-1.1 宽松许可证开源。
VIMA提出了一种统一的多模态提示接口,将多样化的机器人操作任务转化为序列建模问题。通过Transformer编码器-解码器架构和物体中心表示,VIMA在零样本泛化设置下任务成功率最高提升2.9倍。
NVIDIA 的 Vesta 用单一 Qwen3-VL-8B 基础模型统一定位、空间推理、导航和长程规划四大具身智能能力,取代了传统的拼装专家路线。它通过统一的条件语言生成范式和简洁的多模态记忆挽具,让自注意力在历史帧与当前观察间建立长程依赖。平均超越各类别最优专家 20% 以上,真机任务成功率提升超 35%。