论文精读|Percept-WAM:把 2D/3D 感知'种'进 VLM 里的感知增强世界动作模型

Percept-WAM 回答的是 WAM 系列的另一个致命问题:VLM 的空间感太差——‘定位漂移、时序不一致、置信度虚高’,导致 VLA 系统的感知和规划都不稳。它把 2D/3D 感知任务直接’种’进单个 VLM 里:用 World-PV token(透视视角)和 World-BEV token(鸟瞰视角)编码可定位的世界状态,配合网格条件化预测头、IoU 校准置信度和并行自回归解码,再用四组点级 query(Q_pv/Q_bev/Q_ego/Q_full)把感知表示对齐成轨迹。NAVSIM v1 拿到 90.2 PDMS,超过 DiffusionDrive 2.1,还配了流式推理把时延压到 707ms。

2026年8月19日 · 7 分钟 · 1480 字 · 

论文精读|BrainWAM:大脑式'动作空间协调'——把 VLA 语义先验和 WAM 预测动态拧成一股绳

BrainWAM 用’大脑分工’的思路回答一个根本问题:VLA(语义推理)和 WAM(预测动态)到底该怎么结合?它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号;再受左右脑半球经胼胝体通信、小脑协调运动意图的启发,把语义和预测拆成两条特化通路,各自产出’面向动作’的表示,最后在紧凑的动作空间里用 CAB(胼胝体动作桥)双向交换、CIF(小脑意图融合)协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS,双双超过 VLA-only、WAM-only 和 Tri-MoT。

2026年8月19日 · 9 分钟 · 1852 字 ·