Cosmos 3 代码讲解:Mixture-of-Transformers 双塔统一五模态世界模型

「NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构把语言、图像、视频、音频、动作五模态统一进一个世界基础模型。本文从 NVIDIA/cosmos-framework 源码出发,面向零基础读者逐文件讲透 MoT 双塔(PackedAttentionMoT / MoTDecoderLayer 的 dual-QKV/proj 设计)、DCAE 视频 tokenizer(4×32×32 因果 VAE)、Rectified Flow 训练(logit-normal 时间分布 + MSE 向量场损失)、序列打包(und/gen token 混排)、以及推理管线(35 步 UniPC 调度 + 多模态生成),最后与 pi0 / Diffusion Planner / AlpaMayo-R1 对照」

2026年7月29日 · 19 分钟 · 3921 字 · 

论文精读:UniDriveVLA — Mixture-of-Transformers 解耦感知-推理冲突的统一驾驶 VLA

UniDriveVLA 提出 Mixture-of-Transformers 架构,通过理解/感知/规划三个专家解耦感知-推理冲突,结合 Masked Joint Attention 与稀疏感知范式,在 nuScenes 开环和 Bench2Drive 闭环上均达到 SOTA。

2026年7月19日 · 6 分钟 · 1115 字 ·