论文精读|Metis:用'非对称注意力掩码'把视频生成与动作预测解耦的世界动作模型
Metis 用 Mixture-of-Transformers 把’视频生成专家’和’动作预测专家’拆成两个独立 Transformer,再用一张非对称注意力掩码管理二者的信息流:动作只看向当前帧,未来视频可以看动作。训练时联合优化两者学到世界动态,推理时直接跳过视频生成只跑动作分支——NAVSIM-v2 navhard/navtest 和 CityWalker 全面 SOTA,纯动作推理比带视频快 8 倍,还零样本部署到四足机器人。