知识精讲|ViT与视觉架构进化详解
从 ViT 到 ConvNeXt,视觉架构在 Transformer 与卷积之间完成了一个轮回。本文系统梳理 ViT 的核心机制(patch embedding、position encoding、class token),详解 DeiT、Swin、ConvNeXt 等关键演进,并分析多尺度特征金字塔与 VLA 视觉编码器的选型逻辑与缩放定律。
从 ViT 到 ConvNeXt,视觉架构在 Transformer 与卷积之间完成了一个轮回。本文系统梳理 ViT 的核心机制(patch embedding、position encoding、class token),详解 DeiT、Swin、ConvNeXt 等关键演进,并分析多尺度特征金字塔与 VLA 视觉编码器的选型逻辑与缩放定律。
Transformer 凭借自注意力机制的长程依赖建模与并行计算能力,从 NLP 席卷至自动驾驶全栈。本文从缩放点积注意力的数学原理出发,系统梳理 Multi-Head Attention、ViT、BEVFormer 及 VLM 中 Causal Attention 的关键技术。为理解 Transformer 在自动驾驶感知与规划中的应用奠定理论基础。
TransFuser 在 CARLA 上首次验证了 Transformer 做多模态传感器融合的可行性——用自注意力让图像和 LiDAR 特征在多个分辨率上密集交互,取代简单的几何融合。在 CARLA Leaderboard 和 Longest6 基准上以显著优势领先此前所有方法,将碰撞率降低 48%。