论文精读|NVIDIA Cosmos 3:全模态世界基础模型开启物理AI新纪元

NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构将语言、图像、视频、音频、动作五模态统一进单一世界基础模型。Reasoner 塔负责语义推理,Generator 塔负责高保真生成,两塔通过共享跨模态注意力深度耦合。在 8 项物理 AI 基准上取得开放模型第一,并以 OpenMDW-1.1 宽松许可证开源。

2026年7月19日 · 4 分钟 · 697 字 · 

论文精读|VIMA:基于多模态提示的通用机器人操作——多模态大模型驱动机器人

VIMA提出了一种统一的多模态提示接口,将多样化的机器人操作任务转化为序列建模问题。通过Transformer编码器-解码器架构和物体中心表示,VIMA在零样本泛化设置下任务成功率最高提升2.9倍。

2026年7月28日 · 1 分钟 · 205 字 · 

论文精读|Vesta:统一的具身推理通用模型

NVIDIA 的 Vesta 用单一 Qwen3-VL-8B 基础模型统一定位、空间推理、导航和长程规划四大具身智能能力,取代了传统的拼装专家路线。它通过统一的条件语言生成范式和简洁的多模态记忆挽具,让自注意力在历史帧与当前观察间建立长程依赖。平均超越各类别最优专家 20% 以上,真机任务成功率提升超 35%。

2026年7月19日 · 3 分钟 · 607 字 ·