损失函数完全指南:从 L1 到 GRPO——端到端自动驾驶中的 Loss 设计哲学

读论文时被各种 Loss 搞晕了?L1、L2、Focal、KL 散度、碰撞 Loss、GRPO……为什么同一个任务在不同文章里用的 Loss 不一样?这篇文章帮你把端到端自动驾驶里的所有损失函数理清楚——每种 Loss 的数学形式、直觉理解、适用场景,以及它们之间的演进关系。

2026年7月30日 · 10 分钟 · 2112 字 · 

个人思考|VLA 都有了视觉编码器,为什么还需要感知模块?

VLA(Vision-Language-Action)模型自带 ViT 视觉编码器,为什么自动驾驶还需要 3D 检测、BEV 感知、占用网络这些传统感知模块?它们之间到底是替代关系还是互补关系?本文从 14 篇论文精读出发,盘点感知与 VLM 的十种协同模式,详解有 BEV 与无 BEV 感知的实现方法,并解释为什么只有 2D 相机、没有显式 BEV/occ 的模型也能表现不错——关键在于区分’感知任务’与’显式感知表示’。

2026年7月27日 · 9 分钟 · 1851 字 · 

个人思考|自动驾驶感知模块全景:从传感器到BEV再到占用网络,到底在感知什么

一篇全景式讲解自动驾驶感知模块的技术文章。从传感器硬件讲起,覆盖3D目标检测、BEV感知、占用网络、语义分割、多目标跟踪,以及它们如何输出给下游的预测和规划模块。附完整感知流水线图。

2026年7月27日 · 4 分钟 · 650 字 · 

个人思考|自动驾驶技术全景学习指南:从基础到前沿的六范式知识体系

一份面向自动驾驶从业者的全景式学习指南。系统梳理六大技术范式(端到端E2E、VLA、世界模型、Scoring规划、JEPA、RL+生成)的核心概念、代表工作、联系脉络和知识依赖。附自测清单和推荐阅读路线,帮助你定位自己的知识短板。

2026年7月27日 · 11 分钟 · 2255 字 · 

个人思考|JEPA-DRIVE:用联合嵌入预测架构做自监督驾驶决策

JEPA-DRIVE 是一个基于 Joint Embedding Predictive Architecture 的自监督驾驶决策系统。它用结构化隐空间世界模型编码驾驶场景,从 65,536 个离散行为词汇中组合生成候选轨迹,再用 cycle energy 重建误差作为自监督评分信号。V17 在 NAVSIM 上达到 0.8839 selected_pdm,V21 正在用纯自监督 cycle energy 突破 PDM 代理标签的 64 值瓶颈(8×A800 分布式训练中)。全模型仅 3.88M 参数。

2026年7月24日 · 8 分钟 · 1561 字 · 

论文精读|LinkVLA:统一语言-动作理解与生成的 VLA 架构

LinkVLA 提出将语言指令和驾驶轨迹统一到共享离散词表的 VLA 架构,通过对数坐标变换+空间软标签实现连续轨迹的离散化,引入动作理解反向目标建立双向语义映射,并用 C2F 两步解码替代逐点自回归。在 Bench2Drive (CARLA v2) 上 DS 达 91.01(超 SimLingo 5.94 分,+6.98%),推理延迟从 361ms 降到 48ms。主要作者来自浙大和理想汽车,收录于 CVPR 2026。

2026年7月24日 · 7 分钟 · 1294 字 · 

个人思考|强化学习 + 生成式轨迹规划:四种范式、核心挑战与未来方向

RL + 生成式轨迹是 2025-2026 最火热的方向之一。本文从一个小白的视角,梳理 SFT 的天花板、四种 RL 范式(奖励引导、拒绝采样、策略梯度、世界模型),深入分析 log-prob 难题和 reward hacking,用大量对比图和流程图让每个概念一目了然。最后给出了自己的理解和未来方向判断。

2026年7月22日 · 16 分钟 · 3355 字 · 

ROS/ROS2入门:自动驾驶中的通信中间件

ROS/ROS2是自动驾驶和机器人领域的行业标准中间件,但研究新手往往低估了它的重要性。本文从发布-订阅模型出发,讲解ROS2的核心概念(node/topic/service/action)、DDS通信中间件的QoS策略(reliability/durability/deadline)、TF坐标树与消息同步、rosbag的数据录制与回放,以及自动驾驶系统中常用的消息类型栈(sensor_msgs/nav_msgs/visualization_msgs)。

2026年7月19日 · 6 分钟 · 1170 字 · 

场景理解与Failure Analysis:定位自动驾驶的边界

自动驾驶系统的每次路测都会产生大量bad case,如何从海量数据中系统化地分析模型失败的根因是一项关键工程能力。本文讲解failure analysis的方法论框架:场景分类taxonomy(感知失败/预测失败/规划失败/控制失败)、故障归因的ablation策略、场景还原与仿真复现、长尾场景的systematic discovery(基于聚类/基于异常检测/基于对抗搜索)、以及建立持续性的bad case追踪与回归防御体系。

2026年7月19日 · 6 分钟 · 1207 字 · 

仿真器搭建与闭环测试:从CARLA到SIL/HIL

仿真测试是自动驾驶安全验证的核心手段,但搭建一套好用的仿真测评系统远比想象中复杂。本文讲解主流仿真器的选型对比(CARLA/MetaDrive/NVIDIA Isaac Sim/AlpaSim)、传感器仿真与渲染管线、SIL(Software-in-the-Loop)与HIL(Hardware-in-the-Loop)测试架构、场景编辑器构建与参数化场景生成、以及大规模并行仿真与回归测试的工程落地经验。

2026年7月19日 · 3 分钟 · 523 字 · 

前沿VLA模型全景速览:从RT-2到GR-3

VLA模型从2023年的RT-2到2026年的GR-3经历了三代演进。本文系统对比15+主流VLA模型的核心设计选择:动作表征(tokenization/连续控制/扩散策略)、视觉编码器架构、LLM backbone选择、以及训练范式(预训练→指令微调→RLHF)。重点分析pi0的Flow Matching动作头、GR-3的CoT推理与自回归架构、BridgeVLA的桥接监督等前沿技术路线。

2026年7月19日 · 4 分钟 · 780 字 · 

主流自动驾驶方案对比:FSD vs Momenta vs 华为 vs 小鹏

全球自动驾驶行业已形成中美两强的竞争格局,不同公司的技术路线选择反映了对’什么是正确的自动驾驶’的深层假设差异。本文从感知架构(BEV vs 占据网络 vs 端到端)、规划方法(规则+ML hybrid vs 纯端到端)、数据策略(真实数据 vs 仿真数据 vs 生成数据)、系统架构(模块化 vs one-model)四个维度,深度对比Tesla FSD、Momenta、华为ADS和小鹏XNGP的技术异同,并分析各路线在2026年的收敛趋势。

2026年7月19日 · 11 分钟 · 2168 字 · 

论文精读|DriveVLM:把大语言模型推理能力搬上自动驾驶

DriveVLM 是首个系统性地把视觉语言模型用于自动驾驶场景理解与推理的工作。它提出双系统架构——VLM 慢系统做思维链推理输出高层决策,传统规划器快系统做安全执行。在 CARLA 闭环评测中大幅超越基线,为 VLA 的 Dual-System 范式奠定基础。

2026年7月17日 · 3 分钟 · 557 字 · 

什么是 VLA(Vision-Language-Action)模型?

VLA 模型将视觉理解、语言推理和动作执行统一到一个端到端网络中,引入大语言模型的常识推理能力解决自动驾驶长尾场景问题。本文剖析其视觉编码器、LLM 与动作头的标准三组件架构,以及从 LLaVA、RT-2、DriveVLM 到 VLA 的完整演进路线。VLA 正成为后端到端时代自动驾驶的新技术范式。

2026年7月17日 · 4 分钟 · 689 字 · 

自动驾驶学习路径总目录|用我的论文精读串成的金字塔地图

参考’少读要比乱读强’的思路,把我论文精读区的文章按’地基→BEV感知→端到端→世界模型→扩散+强化学习→VLA’六层金字塔组织起来。顺着层往上走,每层解决上一层留下的问题,最后落在 VLA/世界模型这些前沿范式上。这是本站论文精读的总入口。

2026年8月5日 · 3 分钟 · 428 字 · 

论文精读|ST4VLA:空间引导训练实现鲁棒的视觉-语言-动作模型

ST4VLA 提出双阶段空间引导训练框架:第一阶段用点、框、轨迹预测进行空间接地预训练注入空间先验;第二阶段用空间提示引导动作生成。在 SimplerEnv 上 Google Robot 从 66.1 提升到 84.6,WidowX 从 54.7 提升到 73.2,并展现对未见物体和复杂长时任务的强泛化。

2026年7月24日 · 2 分钟 · 274 字 · 

VLA大模型训练技巧:混合精度×梯度检查点×序列并行

训练VLA模型远远不止’用DeepSpeed跑起来’这么简单,当模型规模从7B增长到70B参数时,显存瓶颈和通信开销会逼你深入理解每一个训练技巧的原理和trade-off。本文从混合精度训练(FP16 vs BF16 vs FP8的精度缩放策略)、梯度检查点(selective checkpointing vs full checkpointing vs recomputation profiling)、activation offloading(CPU offloading vs NVMe offloading)、序列并行(Ring Attention + sequence parallelism + context parallelism)四个核心技巧展开,配合VLA特有的多模态编码器训练优化,给出实用的训练配置建议与常见调优诊断方法。

2026年7月19日 · 24 分钟 · 5050 字 · 

论文精读|π0:基于Flow Matching的通用视觉-语言-动作模型

π0 用预训练 VLM 做大脑、Flow Matching 做动作头,开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单,相比离散化精度更高,巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练,一个模型搞定从叠衣服到收桌子的多种高难度操作。

2026年7月18日 · 3 分钟 · 580 字 · 

什么是世界模型(World Model)?

世界模型让 AI 在脑中预演未来,学习现实世界的物理规律与交通规则后生成逼真的驾驶场景。本文对比生成式(像素空间预测)与表征式(潜在空间预测)两大流派各自的哲学与优劣。世界模型是解决自动驾驶真实数据稀缺与长尾场景覆盖的核心基础设施。

2026年7月17日 · 2 分钟 · 418 字 · 

自动驾驶优质博客收藏夹|随手存,少逛,逛精

把平时刷到的优秀自动驾驶博客/资源链接集中存到这里,避免日后找不到。主打一个’少逛、逛精’——每篇能持续产出高质量内容才放进收藏。持续更新。

2026年8月5日 · 1 分钟 · 108 字 ·