论文精读|DriveTransformer:统一Transformer——告别BEV,拥抱稀疏Token并行交互
DriveTransformer 彻底抛弃了 BEV 表示——不再构建稠密 BEV 特征,而是让任务 query 直接与原始传感器特征交互。三种注意力(Sensor Cross-Attention、Task Self-Attention、Temporal Cross-Attention)构成统一框架,支持单阶段端到端训练。在 Bench2Drive 闭环评测中以 63.46 Driving Score 大幅超越 UniAD(45.81)和 VAD(42.35),且在鲁棒性上碾压 BEV 方案。获 ICLR 2025 接收。