Cosmos 3 代码讲解:Mixture-of-Transformers 双塔统一五模态世界模型

「NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构把语言、图像、视频、音频、动作五模态统一进一个世界基础模型。本文从 NVIDIA/cosmos-framework 源码出发,面向零基础读者逐文件讲透 MoT 双塔(PackedAttentionMoT / MoTDecoderLayer 的 dual-QKV/proj 设计)、DCAE 视频 tokenizer(4×32×32 因果 VAE)、Rectified Flow 训练(logit-normal 时间分布 + MSE 向量场损失)、序列打包(und/gen token 混排)、以及推理管线(35 步 UniPC 调度 + 多模态生成),最后与 pi0 / Diffusion Planner / AlpaMayo-R1 对照」

2026年7月29日 · 19 分钟 · 3921 字 · 

AlpaMayo-R1 代码讲解:VLM 说推理链、Expert 雕轨迹、一个模型两套头

零基础逐文件拆解 NVIDIA AlpaMayo-R1 推理源码:从 VLM/Expert/Diffusion 三组件架构到单轮动力学动作空间,从 Flow Matching 去噪到 Fourier 特征编码,用伪代码 + 大白话讲清这个 10B 参数的 VLA 模型是怎么从传感器数据一路「推理」到轨迹输出的。

2026年7月22日 · 16 分钟 · 3268 字 ·