这页是本站论文精读区的总目录。很多文章单独看都懂,但串不起来。参考学习路径的思路,我按"金字塔"把它们分层:每一层解决上一层留下的问题,顺着层往上读,最后正好落在 VLA / 世界模型这些前沿范式上。

🏔️ 先给你全局视图:六层金字塔

第六层【前沿范式】 VLA / 世界模型 / 强化微调      ← 当前最热,本站的重心
第五层【生成式规划】 扩散规划 + 强化学习(GRPO)   ← AlphaDrive/DiffusionDrive/Flow-GRPO
第四层【世界模型】   DreamerV3/Cosmos/GEN-1...   ← 预测未来·做数据工厂
第三层【端到端规划】 UniAD / VAD / SparseDrive    ← 2023-2024 主战场
第二层【BEV 感知】   BEVFormer / Sparse4D         ← 行业基石
第一层【地基】       Transformer / ViT            ← 一切的源头

阅读总原则:按层往上走。跳层读会痛苦(没读 BEVFormer 直接看 VLA,感知那部分会糊涂)。每层里我标了"必读"和"进阶",按顺序点进去即可。


📍 第 0 站:先看全景再进层

进任何层之前,先读这三份,建立坐标系:

读完这几份,再进金字塔,就知道每篇论文"躺在哪一层、为谁服务"。


第一层:地基(Transformer / ViT)

不读这两块,后面全是天书——所有端到端/VLA/世界模型都建立在 Transformer 上。

  • ⭐ 必读:Attention Is All You Need (Transformer)——注意力机制的开山作(理解"自注意力怎么并行 + 全局感受野")
  • ⭐ 必读:ViT: An Image is Worth 16x16 Words——图像切 patch 当 token,视觉 token 一切的源头
  • 📌 我这里的底层参考:Transformer → ViT 的 patch 思想 -> 一切视觉模型输入来源

本站精读偏工程/前沿,地基理论靠经典论文原文补。可先用我写的 VLA vs 感知:两种路线怎么选 建立感性认识,再回去补理论。


第二层:BEV 感知(行业基石)

解决"多路相机图像怎么变成统一的鸟瞰表示"。你读 VLA/V 世界模型前,感知这层必须有。


第三层:端到端规划(2023-2024 主战场)

解决"感知→预测→规划各模块误差累积 / 目标不一致"。代表作是模块化端到端的巅峰。


第四层:世界模型(预测未来 + 做数据工厂)

解决"真车训练太危险、长尾场景太少"。用生成式模型预测/合成未来场景,既是世界模型又是闭环训练环境。


第五层:生成式规划 + 强化学习(本站重心)

解决"模仿学习有天花板,模型最多和人类一样好"。用**扩散/Flow 生成轨迹 + 强化学习(GRPO)**突破上限。这是你读 Flow-GRPO 的落地点。

扩散 / Flow 生成式规划

强化学习微调(GRPO 进入驾驶)

我的深入讲解(综合)


第六层:VLA 与具身智能(前沿范式)

解决"端到端网络遇到长尾场景泛化差"。用视觉-语言-动作统一模型,既能开自动驾驶车又能操作机器人。

VLA 模型

具身 / 机器人基础

数据 / 工程


🚚 商用车 / 重卡专题(按需)

工程与安全重卡方向的一批精读,按你当前项目取用:


🧭 建议阅读顺序(一个月路线)

阶段读什么目标
第 1 周第 0 站全景 + 第二层 BEV建立感知坐标系
第 2 周第三层 端到端(UniAD/VAD)懂为什么行业要端到端
第 3 周第四层 世界模型懂 VLA/世界模型怎么来
第 4 周第五层 扩散+GRPO → Flow-GRPO 完全讲解抵达你的核心方向

更多精读文章在 📁 论文精读分类 里按时间排(上百篇)。这页是"该先读哪些"的精选骨架,那页是"全部藏货"。