知识精讲|ViT与视觉架构进化详解

从 ViT 到 ConvNeXt,视觉架构在 Transformer 与卷积之间完成了一个轮回。本文系统梳理 ViT 的核心机制(patch embedding、position encoding、class token),详解 DeiT、Swin、ConvNeXt 等关键演进,并分析多尺度特征金字塔与 VLA 视觉编码器的选型逻辑与缩放定律。

2026年7月19日 · 4 分钟 · 820 字 · 

知识点拆解|Transformer与注意力机制基础

Transformer 凭借自注意力机制的长程依赖建模与并行计算能力,从 NLP 席卷至自动驾驶全栈。本文从缩放点积注意力的数学原理出发,系统梳理 Multi-Head Attention、ViT、BEVFormer 及 VLM 中 Causal Attention 的关键技术。为理解 Transformer 在自动驾驶感知与规划中的应用奠定理论基础。

2026年7月19日 · 3 分钟 · 603 字 · 

论文精读|TransFuser:用 Transformer 做传感器融合——让相机和激光雷达"商量着开车"

TransFuser 在 CARLA 上首次验证了 Transformer 做多模态传感器融合的可行性——用自注意力让图像和 LiDAR 特征在多个分辨率上密集交互,取代简单的几何融合。在 CARLA Leaderboard 和 Longest6 基准上以显著优势领先此前所有方法,将碰撞率降低 48%。

2026年7月30日 · 8 分钟 · 1665 字 ·