技术博客
自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享
📅 2026
JUL
19
知识精讲|ViT与视觉架构进化详解
从 ViT 到 ConvNeXt,视觉架构在 Transformer 与卷积之间完成了一个轮回。本文系统梳理 ViT 的核心机制(patch embedding、position encoding、class token),详解 DeiT、Swin、ConvNeXt 等关键演进,并分析多尺度特征金字塔与 VLA 视觉编码器的选型逻辑与缩放定律。
JUL
19
知识点拆解|GRPO 强化学习方法详解:从 DeepSeek 到自动驾驶
GRPO 用'组内相对优势'替代 PPO 的 critic 网络,大幅降低大模型强化学习的训练成本与显存开销。它通过对同一 prompt 采样一组回答并基于组内奖励均值做基线来实现策略优化。已在 DeepSeek-R1 及自动驾驶项目 AlphaDrive、Flow-GRPO 中成为首选 RL 算法。
JUL
19
模型评估体系与回归检测:守护版本质量
自动驾驶模型需要频繁迭代,但如何确保新版本'不比旧版本差'是一个被严重低估的工程难题。本文讲解模型回归检测的全套实践:离线评估Pipeline搭建(开环感知指标/闭环规划指标/计算延迟)、回归测试集的设计原则(场景覆盖/难度层级/对抗样本)、指标一致性分析(confidence interval/statistical significance/effect size)、以及CI/CD流水线中的自动化门禁机制(regression gate+人工review)。
JUL
19
论文精读|Qwen-VLA:阿里通义千问统一视觉-语言-动作基础模型
阿里 Qwen-VLA 用'认知主干+运动专家'双模块解耦架构(类比大脑皮层与小脑分工),将操作、导航、轨迹预测三类异构具身决策问题统一进同一模型。它采用 T2A→CPT→SFT→RL 四阶段渐进训练策略,稳定解决预训练 VLM 与随机初始化 DiT 动作解码器的不对称训练问题。在多机器人本体和多任务家族上展现一致跨任务性能与强分布外泛化。
JUL
19
模型部署入门详解:从 PyTorch 到车端推理
模型部署是将训练好的深度学习模型转换、优化并部署到车端推理引擎的过程。本文讲解 ONNX/TensorRT 的核心概念、FP16/INT8 量化原理、VLA 大模型的边缘部署挑战,以及 Orin 等主流车端硬件的技术参数。
JUL
19
论文精读|ReCogDrive:小米EV强化认知端到端自动驾驶框架
华科×小米EV 提出 ReCogDrive,将 VLM 认知推理(场景理解与决策分析)、扩散规划器(连续轨迹生成)和 DiffGRPO 强化学习(安全优化)三阶段统一。它的层级化数据流水线自动生成含推理链的 VQA 标注,解决了 VLM'会想但不会开'的模态错配问题。在 NAVSIM 和 Bench2Drive 上达到 SOTA,验证了'认知-规划-优化'三分天下的 VLA 设计范式。
JUL
19
多智能体交互决策:博弈论在自动驾驶中的应用
自动驾驶并非独角戏,自车与其他交通参与者之间的交互博弈是最具挑战的决策问题。本文从博弈论基础(纳什均衡/Stackelberg博弈/势博弈)出发,讲解交互决策的核心挑战(部分可观测/意图不确定性/计算实时性),主流方法对比(基于规划的IV-game→基于学习的MADRL→基于模型的Gameformer),以及在换道博弈、无保护左转、环岛通行等典型场景中的应用实践。
JUL
19
AlpaSim 详解:面向强化学习的自动驾驶仿真评测框架
AlpaSim 是一个面向强化学习训练与评测的自动驾驶仿真框架,支持闭环训练、多场景评测和安全验证。它采用微服务架构与神经渲染引擎 NRE,兼顾传感器保真度与横向可扩展性。是连接驾驶策略训练和部署验证的关键基础设施。
JUL
19
论文精读|DiffusionDrive:扩散模型驱动的端到端轨迹规划
DiffusionDrive 将扩散模型引入自动驾驶轨迹规划,从噪声出发逐步去噪生成多条合理轨迹,解决了确定性回归的 mode averaging 痛点。它通过轨迹初始化先验和截断扩散策略大幅减少采样步数,让扩散规划真正跑在车端。在闭环评测中达到生成式端到端驾驶的领先水平。
JUL
19
驾驶数据标注与处理:从人工标注到自动化范式
数据是自动驾驶系统的燃料。本文系统梳理 2D/3D/Temporal 标注的规范与工具,介绍自动标注(auto-labeling)、NeRF/3DGS 数据生成等前沿范式,覆盖 nuScenes、Waymo 等主流数据集和 corner case 挖掘策略。
JUL
19
JEPA 详解:LeCun 的联合嵌入预测架构与自动驾驶应用
JEPA 是 Yann LeCun 提出的自监督表征学习框架,核心思想是在嵌入空间做预测而非重建像素,避免了对决策无关细节的浪费。它采用双编码器加预测器的架构,配合 EMA 目标编码器与 stop-gradient 机制实现稳定训练。在自动驾驶世界模型中已成为生成式方法的重要替代方案。
JUL
19
在线地图构建基础:从传感器到结构化地图
在线高精地图构建是自动驾驶感知的核心模块之一,它从传感器数据中实时重建车道线、边界、路口等道路元素。本文详解 HDMapNet、MapTR、VectorMapNet 等代表性方案的技术路线,覆盖分割→向量化、端到端 Transformer 解析、车道图构建,以及地图在规划中的约束作用。
JUL
19
论文精读|SparseDriveV2:Scoring is All You Need——可扩展轨迹词表与打分
SparseDriveV2 把'打分式规划'推向极致:把时空轨迹分解成几何路径✕速度剖面两份词表,用组合式构图构造出比此前稠密 32 倍的超密集轨迹词表;再配合'粗粒度分解打分 + 细粒度组合打分'的可扩展打分策略,让打分计算量与词表大小解耦。在 NAVSIM v2 上达到 90.1 EPDMS,位居打分式与生成式方法的 SOTA。
JUL
19
Flow-GRPO 详解:流匹配策略的强化学习优化
Flow-GRPO 将 Group Relative Policy Optimization 引入流匹配策略训练,让扩散/流匹配模型不再只靠模仿学习,而是能通过奖励信号自主探索更优的驾驶策略。它采用 ODE-to-SDE 转换与 Denoising Reduction 技术,在 SD3、FLUX 等模型上验证了有效性。为生成式模型在自动驾驶规划中的强化学习优化提供了全新范式。
JUL
19
自动驾驶 3D 坐标系统详解:从传感器到世界
3D 坐标系统是自动驾驶感知的数学基石。本文详解六大坐标系(世界、自车、相机、LiDAR、BEV、图像像素)的定义与变换关系,覆盖针孔投影、内外参标定、3D↔2D 投影流程,以及 BEVFormer 等模型中的坐标变换设计。理解坐标系统就等于理解了感知流水线的数学骨架。
JUL
19
论文精读|NVIDIA Cosmos 3:全模态世界基础模型开启物理AI新纪元
NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构将语言、图像、视频、音频、动作五模态统一进单一世界基础模型。Reasoner 塔负责语义推理,Generator 塔负责高保真生成,两塔通过共享跨模态注意力深度耦合。在 8 项物理 AI 基准上取得开放模型第一,并以 OpenMDW-1.1 宽松许可证开源。
JUL
19
NAVSIM 详解:自动驾驶规划的事实标准评测基准
NAVSIM 是当前自动驾驶规划领域最重要的开环评测基准,几乎所有端到端新工作都在上面比拼 PDMS 分数。它基于 OpenScene 数据设计了非反应式仿真框架,以 PDMS/EPDMS 为核心指标抛弃传统 L2 误差思路。是端到端规划从学术研究走向工业落地的关键度量工具。
JUL
19
论文精读|DriveVLA-W0:世界模型放大自动驾驶数据缩放律
DriveVLA-W0 用世界模型给 VLA 大模型补上稠密监督,解决了大参数模型仅用稀疏轨迹信号训练的'监督赤字'问题。它同时预测未来动作和未来图像,用像素级稠密监督逼模型学懂物理动力学。单目前视相机即刷新 NAVSIM 榜单,证明了'世界模型放大数据缩放律'的路线可行性。
JUL
19
VLA大模型训练技巧:混合精度×梯度检查点×序列并行
训练VLA模型远远不止'用DeepSpeed跑起来'这么简单,当模型规模从7B增长到70B参数时,显存瓶颈和通信开销会逼你深入理解每一个训练技巧的原理和trade-off。本文从混合精度训练(FP16 vs BF16 vs FP8的精度缩放策略)、梯度检查点(selective checkpointing vs full checkpointing vs recomputation profiling)、activation offloading(CPU offloading vs NVMe offloading)、序列并行(Ring Attention + sequence parallelism + context parallelism)四个核心技巧展开,配合VLA特有的多模态编码器训练优化,给出实用的训练配置建议与常见调优诊断方法。
JUL
19
主流自动驾驶方案对比:FSD vs Momenta vs 华为 vs 小鹏
全球自动驾驶行业已形成中美两强的竞争格局,不同公司的技术路线选择反映了对'什么是正确的自动驾驶'的深层假设差异。本文从感知架构(BEV vs 占据网络 vs 端到端)、规划方法(规则+ML hybrid vs 纯端到端)、数据策略(真实数据 vs 仿真数据 vs 生成数据)、系统架构(模块化 vs one-model)四个维度,深度对比Tesla FSD、Momenta、华为ADS和小鹏XNGP的技术异同,并分析各路线在2026年的收敛趋势。