知识点拆解|离线强化学习详解:从 CQL、IQL 到自动驾驶 VLA
离线 RL 让智能体从静态数据集中学习,无需在线交互,对自动驾驶等安全关键领域至关重要。本文详解 CQL、IQL、TD3+BC 等核心算法,讨论分布偏移与 OOD 动作问题,并梳理离线预训练→在线微调范式在 VLA 驾驶模型中的应用与趋势。
离线 RL 让智能体从静态数据集中学习,无需在线交互,对自动驾驶等安全关键领域至关重要。本文详解 CQL、IQL、TD3+BC 等核心算法,讨论分布偏移与 OOD 动作问题,并梳理离线预训练→在线微调范式在 VLA 驾驶模型中的应用与趋势。
轨迹规划是自动驾驶系统中连接预测与控制的枢纽,其核心任务是在安全、舒适、可行的约束下生成时空轨迹。本文深入讲解 Frenet 坐标系、主流轨迹规划算法分类、碰撞检测与轨迹平滑等核心概念。帮助读者建立从数学基础到工程实践的完整知识框架。
3D 目标检测是自动驾驶感知的核心任务之一。本文从 2D 检测到 3D 检测的额外挑战出发,系统梳理纯视觉、纯 LiDAR 和多传感器融合三大技术路线,分析 DETR3D、BEVFormer、PointPillars、BEVFusion 等代表方法,并探讨在端到端趋势下 3D 检测逐渐被规划吸收的范式转变。
RLHF 通过人类偏好反馈将模型行为对齐到人类期望。本文详解 RLHF 三阶段流程、Bradley-Terry 奖励模型、DPO 直接偏好优化,并分析 GRPO 如何避免显式 reward 建模。在驾驶场景中,偏好对齐天然适配’不同人有不同驾驶风格’这一人类直觉——有人偏好激进、有人偏好保守,RLHF 让 VLA 模型学会按需生成驾驶行为。
多模态对齐是 VLA 的’关键桥梁’——它决定视觉信号能否被 LLM 正确理解。本文梳理从对比损失(CLIP)到 Q-Former(BLIP-2)到 MLP 投影(LLaVA)的对齐方案演进,以及 VLA 如何将对齐从’图像→文本’扩展到’图像→动作’,详解连续动作的 tokenization 策略。
强化学习通过试错交互自主优化策略,是继监督学习之后最具潜力的自动驾驶训练范式。本文从 MDP 五元组出发,系统讲解策略梯度、PPO/SAC/DDPG 等主流 RL 算法的数学原理与演进脉络。并深入分析各算法在自动驾驶决策与规划中的适用场景与落地挑战。
运动预测与行为预测是自动驾驶系统理解周围交通参与者的核心技术,其目标是从历史观测中推断其他车辆、行人、骑行者的未来轨迹。本文从问题定义出发,系统梳理输入输出范式、经典架构、多智能体预测、目标条件预测以及评分机制,并分析预测模块在端到端框架中的演进趋势。
Occupancy 网络通过稠密的 3D 体素网格表示场景,突破了 3D 目标检测对“物体”范畴的限制,可表征任意形状的障碍物与自由空间。本文详解其与检测的差异、OccFormer/FlashOcc/OpenOccupancy 等代表架构,以及在 NIFF 等世界模型中 occupancy 如何作为核心场景表示驱动未来预测与规划决策。
CoT(思维链)让 VLA ‘想清楚再做’,将驾驶决策过程拆解为可解释的推理步骤。本文从 CoT 基础(Few-shot / Zero-shot / Self-consistency)出发,详解 DriveVLM 的场景描述→预测→推理→规划四阶段 CoT、WCog-VLA 的博弈论 Game-CoT、视觉 DCoT,以及 GRPO + CoT 联合训练的 AlphaDrive 范式。
Scoring-based 规划范式是当前端到端自动驾驶规划的主流方法论之一,其核心思想是:先生成多个候选轨迹,再通过学习一个评分网络选出最优轨迹。本文系统性梳理从 BC 回归到多模态评分、扩散采样到强化学习的方法演进,详细解析 Vocabulary-based、动态生成、扩散三类核心范式,并深入 ScoreNet 的设计哲学与关键论文脉络。
扩散模型通过逐步加噪与逆向去噪实现从纯噪声到高质量数据的生成,已成为 GAN 之后最强大的生成范式。本文从 DDPM 的数学推导出发,详细讲解正向加噪过程、反向去噪网络以及条件生成方法。同时梳理了扩散模型在自动驾驶场景生成、轨迹规划中的数据增强应用全景。
逆强化学习(IRL)解决的是’从行为反推动机’的问题——给定专家演示,推断 driving force 背后的 reward 函数。本文详解最大熵 IRL、GAIL/AIRL 对抗方法,阐明 IRL 与 BC、RL 的本质区别,并梳理 IRL 在自动驾驶中的应用:从人类驾驶数据中学习 reward,再用 RL 优化策略。最后讨论偏好 IRL 和 VLM 作为 reward 的最新趋势。
Transformer 凭借自注意力机制的长程依赖建模与并行计算能力,从 NLP 席卷至自动驾驶全栈。本文从缩放点积注意力的数学原理出发,系统梳理 Multi-Head Attention、ViT、BEVFormer 及 VLM 中 Causal Attention 的关键技术。为理解 Transformer 在自动驾驶感知与规划中的应用奠定理论基础。
控制模块是自动驾驶系统中连接规划与车辆执行器的关键桥梁。本文深入讲解车辆运动学与动力学基础模型、经典控制方法(PID、LQR、MPC)、轨迹跟踪算法、以及车辆动力学中的关键物理概念。同时分析端到端自动驾驶中控制角色的转变——从传统控制到’waypoint 直接输出’再到’action chunking’的演进逻辑。
安全是自动驾驶系统的第一性原则。本文系统梳理端到端自动驾驶中的安全机制设计,涵盖碰撞检测与避障、可行驶区域约束、规则安全过滤器、损失函数中的安全项、安全世界模型、主动安全 ADAS 系统及功能安全标准等核心内容。帮助读者构建从算法安全到系统安全的完整认知框架。
自动驾驶依赖多传感器融合来克服单一传感器在弱光、雨雪等场景下的能力边界。本文系统对比摄像头、激光雷达、毫米波雷达等主流传感器的原理与优劣,深入讲解时空同步与多模态融合策略。最后阐述 BEV 作为统一表示空间如何串联感知全链路。
视频生成模型是自动驾驶世界模型的核心技术基础。本文从 VQVAE 的离散潜在表征出发,逐步讲解扩散模型从像素到潜在空间的演进、DiT 架构的 Scaling 特性、因果 VAE 在时序建模中的作用,以及驾驶场景下的多相机视频生成方法全景。
世界模型从预测空间维度可分为像素空间、潜在空间和占用空间三大类别,每种都有不同的代表方法与适用场景。本文系统梳理了 DriveDreamer、GAIA-1、Vista、World4Drive、OccWorld 等主流世界模型,对比其核心技术、条件控制与对规划的支持能力,并给出完整的分类体系与发展脉络。
条件生成是扩散模型落地的关键能力,涉及如何将文本、图像、深度图、驾驶命令等条件信息注入生成过程。本文深入讲解 Classifier-Free Guidance 与 Classifier Guidance 的数学原理、条件注入的四种技术方案、驾驶场景中的多模态条件设计,以及截断扩散和 Flow Matching 等加速方案。
扩散模型与 Flow Matching 是当前生成式 AI 的两大核心范式。本文从 SDE 与 ODE 的统一视角出发,深入讲解扩散模型的随机微分方程解释、Flow Matching 的向量场学习方法、Rectified Flow 的路径整流机制,揭示扩散是 Flow Matching 的特殊情况。同时总结两者在自动驾驶场景生成与轨迹规划中的应用对比。