<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Posts on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/posts/</link>
    <description>Recent content in Posts on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Mon, 07 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/posts/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>损失函数完全指南：从 L1 到 GRPO——端到端自动驾驶中的 Loss 设计哲学</title>
      <link>https://auto-driving-blog.pages.dev/posts/loss-function-guide/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/loss-function-guide/</guid>
      <description>读论文时被各种 Loss 搞晕了？L1、L2、Focal、KL 散度、碰撞 Loss、GRPO……为什么同一个任务在不同文章里用的 Loss 不一样？这篇文章帮你把端到端自动驾驶里的所有损失函数理清楚——每种 Loss 的数学形式、直觉理解、适用场景，以及它们之间的演进关系。</description>
    </item>
    <item>
      <title>个人思考｜VLA 都有了视觉编码器，为什么还需要感知模块？</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/vla-vs-perception/</link>
      <pubDate>Mon, 27 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/vla-vs-perception/</guid>
      <description>VLA（Vision-Language-Action）模型自带 ViT 视觉编码器，为什么自动驾驶还需要 3D 检测、BEV 感知、占用网络这些传统感知模块？它们之间到底是替代关系还是互补关系？本文从 14 篇论文精读出发，盘点感知与 VLM 的十种协同模式，详解有 BEV 与无 BEV 感知的实现方法，并解释为什么只有 2D 相机、没有显式 BEV/occ 的模型也能表现不错——关键在于区分&amp;rsquo;感知任务&amp;rsquo;与&amp;rsquo;显式感知表示&amp;rsquo;。</description>
    </item>
    <item>
      <title>个人思考｜自动驾驶感知模块全景：从传感器到BEV再到占用网络，到底在感知什么</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-perception-guide/</link>
      <pubDate>Mon, 27 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-perception-guide/</guid>
      <description>一篇全景式讲解自动驾驶感知模块的技术文章。从传感器硬件讲起，覆盖3D目标检测、BEV感知、占用网络、语义分割、多目标跟踪，以及它们如何输出给下游的预测和规划模块。附完整感知流水线图。</description>
    </item>
    <item>
      <title>个人思考｜自动驾驶技术全景学习指南：从基础到前沿的六范式知识体系</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-learning-guide/</link>
      <pubDate>Mon, 27 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-learning-guide/</guid>
      <description>一份面向自动驾驶从业者的全景式学习指南。系统梳理六大技术范式（端到端E2E、VLA、世界模型、Scoring规划、JEPA、RL+生成）的核心概念、代表工作、联系脉络和知识依赖。附自测清单和推荐阅读路线，帮助你定位自己的知识短板。</description>
    </item>
    <item>
      <title>个人思考｜JEPA-DRIVE：用联合嵌入预测架构做自监督驾驶决策</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/jepa-drive%E8%87%AA%E7%9B%91%E7%9D%A3%E9%A9%BE%E9%A9%B6%E5%86%B3%E7%AD%96%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/jepa-drive%E8%87%AA%E7%9B%91%E7%9D%A3%E9%A9%BE%E9%A9%B6%E5%86%B3%E7%AD%96%E7%B2%BE%E8%AF%BB/</guid>
      <description>JEPA-DRIVE 是一个基于 Joint Embedding Predictive Architecture 的自监督驾驶决策系统。它用结构化隐空间世界模型编码驾驶场景，从 65,536 个离散行为词汇中组合生成候选轨迹，再用 cycle energy 重建误差作为自监督评分信号。V17 在 NAVSIM 上达到 0.8839 selected_pdm，V21 正在用纯自监督 cycle energy 突破 PDM 代理标签的 64 值瓶颈（8×A800 分布式训练中）。全模型仅 3.88M 参数。</description>
    </item>
    <item>
      <title>论文精读｜LinkVLA：统一语言-动作理解与生成的 VLA 架构</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/linkvla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/linkvla%E7%B2%BE%E8%AF%BB/</guid>
      <description>LinkVLA 提出将语言指令和驾驶轨迹统一到共享离散词表的 VLA 架构，通过对数坐标变换+空间软标签实现连续轨迹的离散化，引入动作理解反向目标建立双向语义映射，并用 C2F 两步解码替代逐点自回归。在 Bench2Drive (CARLA v2) 上 DS 达 91.01（超 SimLingo 5.94 分，+6.98%），推理延迟从 361ms 降到 48ms。主要作者来自浙大和理想汽车，收录于 CVPR 2026。</description>
    </item>
    <item>
      <title>个人思考｜强化学习 &#43; 生成式轨迹规划：四种范式、核心挑战与未来方向</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/rl-diffusion-traj/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/rl-diffusion-traj/</guid>
      <description>RL + 生成式轨迹是 2025-2026 最火热的方向之一。本文从一个小白的视角，梳理 SFT 的天花板、四种 RL 范式（奖励引导、拒绝采样、策略梯度、世界模型），深入分析 log-prob 难题和 reward hacking，用大量对比图和流程图让每个概念一目了然。最后给出了自己的理解和未来方向判断。</description>
    </item>
    <item>
      <title>ROS/ROS2入门：自动驾驶中的通信中间件</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/ros2%E5%85%A5%E9%97%A8/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/ros2%E5%85%A5%E9%97%A8/</guid>
      <description>ROS/ROS2是自动驾驶和机器人领域的行业标准中间件，但研究新手往往低估了它的重要性。本文从发布-订阅模型出发，讲解ROS2的核心概念（node/topic/service/action）、DDS通信中间件的QoS策略（reliability/durability/deadline）、TF坐标树与消息同步、rosbag的数据录制与回放，以及自动驾驶系统中常用的消息类型栈（sensor_msgs/nav_msgs/visualization_msgs）。</description>
    </item>
    <item>
      <title>场景理解与Failure Analysis：定位自动驾驶的边界</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%9C%BA%E6%99%AF%E7%90%86%E8%A7%A3%E4%B8%8Efailure-analysis/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%9C%BA%E6%99%AF%E7%90%86%E8%A7%A3%E4%B8%8Efailure-analysis/</guid>
      <description>自动驾驶系统的每次路测都会产生大量bad case，如何从海量数据中系统化地分析模型失败的根因是一项关键工程能力。本文讲解failure analysis的方法论框架：场景分类taxonomy（感知失败/预测失败/规划失败/控制失败）、故障归因的ablation策略、场景还原与仿真复现、长尾场景的systematic discovery（基于聚类/基于异常检测/基于对抗搜索）、以及建立持续性的bad case追踪与回归防御体系。</description>
    </item>
    <item>
      <title>仿真器搭建与闭环测试：从CARLA到SIL/HIL</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%BB%BF%E7%9C%9F%E5%99%A8%E6%90%AD%E5%BB%BA%E4%B8%8E%E9%97%AD%E7%8E%AF%E6%B5%8B%E8%AF%95/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%BB%BF%E7%9C%9F%E5%99%A8%E6%90%AD%E5%BB%BA%E4%B8%8E%E9%97%AD%E7%8E%AF%E6%B5%8B%E8%AF%95/</guid>
      <description>仿真测试是自动驾驶安全验证的核心手段，但搭建一套好用的仿真测评系统远比想象中复杂。本文讲解主流仿真器的选型对比（CARLA/MetaDrive/NVIDIA Isaac Sim/AlpaSim）、传感器仿真与渲染管线、SIL（Software-in-the-Loop）与HIL（Hardware-in-the-Loop）测试架构、场景编辑器构建与参数化场景生成、以及大规模并行仿真与回归测试的工程落地经验。</description>
    </item>
    <item>
      <title>前沿VLA模型全景速览：从RT-2到GR-3</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%89%8D%E6%B2%BFvla%E6%A8%A1%E5%9E%8B%E5%85%A8%E6%99%AF%E9%80%9F%E8%A7%88/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%89%8D%E6%B2%BFvla%E6%A8%A1%E5%9E%8B%E5%85%A8%E6%99%AF%E9%80%9F%E8%A7%88/</guid>
      <description>VLA模型从2023年的RT-2到2026年的GR-3经历了三代演进。本文系统对比15+主流VLA模型的核心设计选择：动作表征（tokenization/连续控制/扩散策略）、视觉编码器架构、LLM backbone选择、以及训练范式（预训练→指令微调→RLHF）。重点分析pi0的Flow Matching动作头、GR-3的CoT推理与自回归架构、BridgeVLA的桥接监督等前沿技术路线。</description>
    </item>
    <item>
      <title>主流自动驾驶方案对比：FSD vs Momenta vs 华为 vs 小鹏</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%B8%BB%E6%B5%81%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E6%96%B9%E6%A1%88%E5%AF%B9%E6%AF%94/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%B8%BB%E6%B5%81%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E6%96%B9%E6%A1%88%E5%AF%B9%E6%AF%94/</guid>
      <description>全球自动驾驶行业已形成中美两强的竞争格局，不同公司的技术路线选择反映了对&amp;rsquo;什么是正确的自动驾驶&amp;rsquo;的深层假设差异。本文从感知架构（BEV vs 占据网络 vs 端到端）、规划方法（规则+ML hybrid vs 纯端到端）、数据策略（真实数据 vs 仿真数据 vs 生成数据）、系统架构（模块化 vs one-model）四个维度，深度对比Tesla FSD、Momenta、华为ADS和小鹏XNGP的技术异同，并分析各路线在2026年的收敛趋势。</description>
    </item>
    <item>
      <title>论文精读｜DriveVLM：把大语言模型推理能力搬上自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevlm%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevlm%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveVLM 是首个系统性地把视觉语言模型用于自动驾驶场景理解与推理的工作。它提出双系统架构——VLM 慢系统做思维链推理输出高层决策，传统规划器快系统做安全执行。在 CARLA 闭环评测中大幅超越基线，为 VLA 的 Dual-System 范式奠定基础。</description>
    </item>
    <item>
      <title>什么是 VLA（Vision-Language-Action）模型？</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%BB%80%E4%B9%88%E6%98%AFvla%E6%A8%A1%E5%9E%8B/</link>
      <pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%BB%80%E4%B9%88%E6%98%AFvla%E6%A8%A1%E5%9E%8B/</guid>
      <description>VLA 模型将视觉理解、语言推理和动作执行统一到一个端到端网络中，引入大语言模型的常识推理能力解决自动驾驶长尾场景问题。本文剖析其视觉编码器、LLM 与动作头的标准三组件架构，以及从 LLaVA、RT-2、DriveVLM 到 VLA 的完整演进路线。VLA 正成为后端到端时代自动驾驶的新技术范式。</description>
    </item>
    <item>
      <title>自动驾驶学习路径总目录｜用我的论文精读串成的金字塔地图</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/auto-driving-learning-path/</link>
      <pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/auto-driving-learning-path/</guid>
      <description>参考&amp;rsquo;少读要比乱读强&amp;rsquo;的思路，把我论文精读区的文章按&amp;rsquo;地基→BEV感知→端到端→世界模型→扩散+强化学习→VLA&amp;rsquo;六层金字塔组织起来。顺着层往上走，每层解决上一层留下的问题，最后落在 VLA/世界模型这些前沿范式上。这是本站论文精读的总入口。</description>
    </item>
    <item>
      <title>论文精读｜ST4VLA：空间引导训练实现鲁棒的视觉-语言-动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/st4vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/st4vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>ST4VLA 提出双阶段空间引导训练框架：第一阶段用点、框、轨迹预测进行空间接地预训练注入空间先验；第二阶段用空间提示引导动作生成。在 SimplerEnv 上 Google Robot 从 66.1 提升到 84.6，WidowX 从 54.7 提升到 73.2，并展现对未见物体和复杂长时任务的强泛化。</description>
    </item>
    <item>
      <title>VLA大模型训练技巧：混合精度×梯度检查点×序列并行</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/vla%E5%A4%A7%E6%A8%A1%E5%9E%8B%E8%AE%AD%E7%BB%83%E6%8A%80%E5%B7%A7/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/vla%E5%A4%A7%E6%A8%A1%E5%9E%8B%E8%AE%AD%E7%BB%83%E6%8A%80%E5%B7%A7/</guid>
      <description>训练VLA模型远远不止&amp;rsquo;用DeepSpeed跑起来&amp;rsquo;这么简单，当模型规模从7B增长到70B参数时，显存瓶颈和通信开销会逼你深入理解每一个训练技巧的原理和trade-off。本文从混合精度训练（FP16 vs BF16 vs FP8的精度缩放策略）、梯度检查点（selective checkpointing vs full checkpointing vs recomputation profiling）、activation offloading（CPU offloading vs NVMe offloading）、序列并行（Ring Attention + sequence parallelism + context parallelism）四个核心技巧展开，配合VLA特有的多模态编码器训练优化，给出实用的训练配置建议与常见调优诊断方法。</description>
    </item>
    <item>
      <title>论文精读｜π0：基于Flow Matching的通用视觉-语言-动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/pi0-%E9%80%9A%E7%94%A8vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/pi0-%E9%80%9A%E7%94%A8vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>π0 用预训练 VLM 做大脑、Flow Matching 做动作头，开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单，相比离散化精度更高，巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练，一个模型搞定从叠衣服到收桌子的多种高难度操作。</description>
    </item>
    <item>
      <title>什么是世界模型（World Model）？</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%BB%80%E4%B9%88%E6%98%AF%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B/</link>
      <pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%BB%80%E4%B9%88%E6%98%AF%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B/</guid>
      <description>世界模型让 AI 在脑中预演未来，学习现实世界的物理规律与交通规则后生成逼真的驾驶场景。本文对比生成式（像素空间预测）与表征式（潜在空间预测）两大流派各自的哲学与优劣。世界模型是解决自动驾驶真实数据稀缺与长尾场景覆盖的核心基础设施。</description>
    </item>
    <item>
      <title>自动驾驶优质博客收藏夹｜随手存，少逛，逛精</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/auto-driving-blog-collection/</link>
      <pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/auto-driving-blog-collection/</guid>
      <description>把平时刷到的优秀自动驾驶博客/资源链接集中存到这里，避免日后找不到。主打一个&amp;rsquo;少逛、逛精&amp;rsquo;——每篇能持续产出高质量内容才放进收藏。持续更新。</description>
    </item>
    <item>
      <title>论文精读｜NoRD：无需推理的高效数据驱动 VLA</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/nord%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/nord%E7%B2%BE%E8%AF%BB/</guid>
      <description>NoRD 挑战 VLA 对大规模数据和推理标注的依赖，仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差（Difficulty Bias）失效，引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。</description>
    </item>
    <item>
      <title>论文精读｜UniAD：面向规划的端到端自动驾驶框架（CVPR 2023最佳论文）</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/uniad-%E7%AB%AF%E5%88%B0%E7%AB%AF%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E6%A1%86%E6%9E%B6%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/uniad-%E7%AB%AF%E5%88%B0%E7%AB%AF%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E6%A1%86%E6%9E%B6%E7%B2%BE%E8%AF%BB/</guid>
      <description>UniAD 首次将感知、预测、规划全部统一进一个可端到端联合训练的网络，以规划为最终目标反向驱动所有中间任务。它开创了显式端到端新范式，每个模块输出可解释的中间表示，并通过规划导向的联合优化全面提升系统一致性。获 CVPR 2023 最佳论文奖，是自动驾驶端到端路线里程碑式的奠基工作。</description>
    </item>
    <item>
      <title>端到端自动驾驶：从模块化到一体化的演进</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%AB%AF%E5%88%B0%E7%AB%AF%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E6%BC%94%E8%BF%9B/</link>
      <pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%AB%AF%E5%88%B0%E7%AB%AF%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E6%BC%94%E8%BF%9B/</guid>
      <description>端到端自动驾驶将传感器输入直接映射到控制输出，消除了模块化方案中的误差累积与信息瓶颈问题。本文梳理从隐式端到端到显式端到端再到生成式大模型的三代架构演进，对比 UniAD、VAD、VLA 等代表性方案。为理解这一技术路线提供了完整的历史脉络与趋势展望。</description>
    </item>
    <item>
      <title>论文精读｜DriveVLA-M0：失败感知的记忆增强，让 VLA 学会吃一堑长一智</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevla-m0%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevla-m0%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveVLA-M0 给 VLA 自动驾驶加上了&amp;rsquo;失败记忆&amp;rsquo;：离线把模型表现差的场景连同路网/交互结构特征写进 latent memory，在线用专用的 Retrieve Model 检索结构相似的失败案例，再用解耦 LoRA 做测试时训练（TTT）逐场景纠正，让模型&amp;rsquo;吃一堑长一智&amp;rsquo;。NAVSIMv1 上 94.1 PDMS、NAVSIMv2 上 47.0 EPDMS，TTT 后向开销仅 26.44ms。它与同系 DriveVLA-W0 走了完全相反的路：W0 用世界模型换&amp;rsquo;稠密监督&amp;rsquo;，M0 用失败记忆换&amp;rsquo;场景自适应&amp;rsquo;。</description>
    </item>
    <item>
      <title>论文精读｜VLA Safety Survey：视觉-语言-动作模型安全的全面综述</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vla%E5%AE%89%E5%85%A8%E7%BB%BC%E8%BF%B0%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vla%E5%AE%89%E5%85%A8%E7%BB%BC%E8%BF%B0%E7%B2%BE%E8%AF%BB/</guid>
      <description>这是首篇系统梳理 VLA 安全的综述，从攻击时机（训练时/推理时）和防御时机（训练时/推理时）两条平行轴组织文献，涵盖数据投毒、后门攻击、对抗补丁、跨模态扰动、语义越狱等威胁及对应防御，并讨论了 6 大部署领域的安全挑战。</description>
    </item>
    <item>
      <title>论文精读｜AutoVLA：用自适应推理与 GRPO 微调统一「思考」与「动作」的端到端 VLA</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/autovla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/autovla%E7%B2%BE%E8%AF%BB/</guid>
      <description>AutoVLA（NeurIPS 2025, UCLA）把「链式推理 CoT」与「物理动作 token 化」塞进同一个自回归生成模型，用一套代码本把连续轨迹离散成可行动作，再用 SFT 训练出快思考（只出轨迹）与慢思考（带 CoT 推理）双模式，最后用 GRPO 强化微调在简单场景关掉多余推理。它是 NAVSIM v1 上 VLA 路线的代表基线（PDMS 89.1 / 92.1+锚点），也是 DriveVLA-W0 的主要对比对象。</description>
    </item>
    <item>
      <title>论文精读｜DriveVLA-W0：世界模型放大自动驾驶数据缩放律</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevla-w0%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevla-w0%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveVLA-W0 用世界模型给 VLA 大模型补上稠密监督，解决了大参数模型仅用稀疏轨迹信号训练的&amp;rsquo;监督赤字&amp;rsquo;问题。它同时预测未来动作和未来图像，用像素级稠密监督逼模型学懂物理动力学。单目前视相机即刷新 NAVSIM 榜单，证明了&amp;rsquo;世界模型放大数据缩放律&amp;rsquo;的路线可行性。</description>
    </item>
    <item>
      <title>Flow Matching 入门详解：从扩散模型到连续动作生成（含代码讲解）</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/flow-matching%E5%85%A5%E9%97%A8%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/flow-matching%E5%85%A5%E9%97%A8%E8%AF%A6%E8%A7%A3/</guid>
      <description>Flow Matching 通过直接学习从噪声到数据的直线 ODE 路径，解决了扩散模型弯曲路径导致采样步数过多的问题。本文从数学直觉出发讲解向量场、ODE 与流的核心概念，并对比 CFM、Rectified Flow、OT路径等关键变体。与普通教程不同的是，本文所有代码均来自 ByteDance Bagel / Flow-GRPO 的真实项目实现，包含 CFG 推理、SDE 采样、GRPO 策略优化等工业级代码讲解。</description>
    </item>
    <item>
      <title>论文精读｜DLWM：双潜在世界模型实现高斯中心的全方位预训练</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/dlwm%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/dlwm%E7%B2%BE%E8%AF%BB/</guid>
      <description>DLWM 提出双阶段自监督预训练范式：第一阶段用多视图语义和深度重建学习 3D 高斯场景表示；第二阶段训练双潜在世界模型——高斯流引导的潜在预测（占据感知/预测）和自车规划引导的潜在预测（运动规划）。在 nuScenes 上占据预测 +1.02 mIoU，规划 L2 误差降低 16%。</description>
    </item>
    <item>
      <title>论文精读｜AlpaMayo-R1：因果推理链 &#43; RL 驱动的 VLA 驾驶策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/alpamayo-r1%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/alpamayo-r1%E7%B2%BE%E8%AF%BB/</guid>
      <description>NVIDIA 提出 AlpaMayo-R1，一个融合 Chain of Causation 因果推理与 GRPO 强化学习的 VLA 模型。它基于 Cosmos-Reason VLM 骨干，通过结构化 CoC 数据集实现决策锚定的因果推理，利用 Flow Matching 动作解码器生成连续轨迹。三阶段训练（动作注入→推理微调→RL后训练）在长尾场景中取得显著提升：规划准确率 +12%，近距离冲突率 -35%，推理质量 +45%。真车路测延迟仅 99ms。</description>
    </item>
    <item>
      <title>BEV 感知技术详解：自动驾驶的鸟瞰图视角</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/bev%E6%84%9F%E7%9F%A5%E6%8A%80%E6%9C%AF%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/bev%E6%84%9F%E7%9F%A5%E6%8A%80%E6%9C%AF%E8%AF%A6%E8%A7%A3/</guid>
      <description>BEV 感知将多摄像头画面统一重投影到以自车为中心的鸟瞰图空间，解决了透视图像到度量空间的根本矛盾。本文详细讲解 LSS 与 Transformer 两条主流视角变换路线，以及 BEVFormer 等代表方法的架构设计。BEV 已是现代端到端自动驾驶感知系统的事实标准中间表示。</description>
    </item>
    <item>
      <title>论文精读｜RAW2Drive：对齐世界模型的强化学习端到端驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/raw2drive%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/raw2drive%E7%B2%BE%E8%AF%BB/</guid>
      <description>RAW2Drive 提出双流模型基强化学习框架，先用特权信息（BEV 语义）高效训练特权世界模型+策略，再通过对齐机制引导原始传感器世界模型的学习，实现首个从原始传感器直接规划端到端 MBRL 方法。在 Bench2Drive 上 DS 达 83.5，超越所有原始传感器基线。</description>
    </item>
    <item>
      <title>NAVSIM 详解：自动驾驶规划的事实标准评测基准</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/navsim%E5%9F%BA%E5%87%86%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/navsim%E5%9F%BA%E5%87%86%E8%AF%A6%E8%A7%A3/</guid>
      <description>NAVSIM 是当前自动驾驶规划领域最重要的开环评测基准，几乎所有端到端新工作都在上面比拼 PDMS 分数。它基于 OpenScene 数据设计了非反应式仿真框架，以 PDMS/EPDMS 为核心指标抛弃传统 L2 误差思路。是端到端规划从学术研究走向工业落地的关键度量工具。</description>
    </item>
    <item>
      <title>论文精读｜NVIDIA Cosmos 3：全模态世界基础模型开启物理AI新纪元</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/cosmos3-%E4%B8%96%E7%95%8C%E5%9F%BA%E7%A1%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/cosmos3-%E4%B8%96%E7%95%8C%E5%9F%BA%E7%A1%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构将语言、图像、视频、音频、动作五模态统一进单一世界基础模型。Reasoner 塔负责语义推理，Generator 塔负责高保真生成，两塔通过共享跨模态注意力深度耦合。在 8 项物理 AI 基准上取得开放模型第一，并以 OpenMDW-1.1 宽松许可证开源。</description>
    </item>
    <item>
      <title>自动驾驶 3D 坐标系统详解：从传感器到世界</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B63d%E5%9D%90%E6%A0%87%E7%B3%BB%E7%BB%9F%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B63d%E5%9D%90%E6%A0%87%E7%B3%BB%E7%BB%9F%E8%AF%A6%E8%A7%A3/</guid>
      <description>3D 坐标系统是自动驾驶感知的数学基石。本文详解六大坐标系（世界、自车、相机、LiDAR、BEV、图像像素）的定义与变换关系，覆盖针孔投影、内外参标定、3D↔2D 投影流程，以及 BEVFormer 等模型中的坐标变换设计。理解坐标系统就等于理解了感知流水线的数学骨架。</description>
    </item>
    <item>
      <title>论文精读｜Percept-WAM：把 2D/3D 感知&#39;种&#39;进 VLM 里的感知增强世界动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/percept-wam%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/percept-wam%E7%B2%BE%E8%AF%BB/</guid>
      <description>Percept-WAM 回答的是 WAM 系列的另一个致命问题：VLM 的空间感太差——&amp;lsquo;定位漂移、时序不一致、置信度虚高&amp;rsquo;，导致 VLA 系统的感知和规划都不稳。它把 2D/3D 感知任务直接&amp;rsquo;种&amp;rsquo;进单个 VLM 里：用 World-PV token（透视视角）和 World-BEV token（鸟瞰视角）编码可定位的世界状态，配合网格条件化预测头、IoU 校准置信度和并行自回归解码，再用四组点级 query（Q_pv/Q_bev/Q_ego/Q_full）把感知表示对齐成轨迹。NAVSIM v1 拿到 90.2 PDMS，超过 DiffusionDrive 2.1，还配了流式推理把时延压到 707ms。</description>
    </item>
    <item>
      <title>论文精读｜MOSAIC：面向端到端自动驾驶的缩放感知数据选择</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/mosaic%E6%95%B0%E6%8D%AE%E9%80%89%E6%8B%A9%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/mosaic%E6%95%B0%E6%8D%AE%E9%80%89%E6%8B%A9%E7%B2%BE%E8%AF%BB/</guid>
      <description>MOSAIC 提出三阶段数据选择框架：聚类分域 → 拟合神经缩放定律 → 迭代选择最大化指标边际增益。在 NAVSIM 上使用 Hydra-MDP 模型，以 42% 更少数据达到全量训练性能，EPDMS 最优。来自 NVIDIA 和 NYU 的 CVPR 2026 工作。</description>
    </item>
    <item>
      <title>Flow-GRPO 详解：流匹配策略的强化学习优化</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/flow-grpo%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/flow-grpo%E8%AF%A6%E8%A7%A3/</guid>
      <description>Flow-GRPO 将 Group Relative Policy Optimization 引入流匹配策略训练，让扩散/流匹配模型不再只靠模仿学习，而是能通过奖励信号自主探索更优的驾驶策略。它采用 ODE-to-SDE 转换与 Denoising Reduction 技术，在 SD3、FLUX 等模型上验证了有效性。为生成式模型在自动驾驶规划中的强化学习优化提供了全新范式。</description>
    </item>
    <item>
      <title>论文精读｜SparseDriveV2：Scoring is All You Need——可扩展轨迹词表与打分</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/sparsedrive-v2%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/sparsedrive-v2%E7%B2%BE%E8%AF%BB/</guid>
      <description>SparseDriveV2 把&amp;rsquo;打分式规划&amp;rsquo;推向极致：把时空轨迹分解成几何路径✕速度剖面两份词表，用组合式构图构造出比此前稠密 32 倍的超密集轨迹词表；再配合&amp;rsquo;粗粒度分解打分 + 细粒度组合打分&amp;rsquo;的可扩展打分策略，让打分计算量与词表大小解耦。在 NAVSIM v2 上达到 90.1 EPDMS，位居打分式与生成式方法的 SOTA。</description>
    </item>
    <item>
      <title>在线地图构建基础：从传感器到结构化地图</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%9C%A8%E7%BA%BF%E5%9C%B0%E5%9B%BE%E6%9E%84%E5%BB%BA%E5%9F%BA%E7%A1%80/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%9C%A8%E7%BA%BF%E5%9C%B0%E5%9B%BE%E6%9E%84%E5%BB%BA%E5%9F%BA%E7%A1%80/</guid>
      <description>在线高精地图构建是自动驾驶感知的核心模块之一，它从传感器数据中实时重建车道线、边界、路口等道路元素。本文详解 HDMapNet、MapTR、VectorMapNet 等代表性方案的技术路线，覆盖分割→向量化、端到端 Transformer 解析、车道图构建，以及地图在规划中的约束作用。</description>
    </item>
    <item>
      <title>论文精读｜BrainWAM：大脑式&#39;动作空间协调&#39;——把 VLA 语义先验和 WAM 预测动态拧成一股绳</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/brainwam%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/brainwam%E7%B2%BE%E8%AF%BB/</guid>
      <description>BrainWAM 用&amp;rsquo;大脑分工&amp;rsquo;的思路回答一个根本问题：VLA（语义推理）和 WAM（预测动态）到底该怎么结合？它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号；再受左右脑半球经胼胝体通信、小脑协调运动意图的启发，把语义和预测拆成两条特化通路，各自产出&amp;rsquo;面向动作&amp;rsquo;的表示，最后在紧凑的动作空间里用 CAB（胼胝体动作桥）双向交换、CIF（小脑意图融合）协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS，双双超过 VLA-only、WAM-only 和 Tri-MoT。</description>
    </item>
    <item>
      <title>论文精读｜Metis：用&#39;非对称注意力掩码&#39;把视频生成与动作预测解耦的世界动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/metis%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/metis%E7%B2%BE%E8%AF%BB/</guid>
      <description>Metis 用 Mixture-of-Transformers 把&amp;rsquo;视频生成专家&amp;rsquo;和&amp;rsquo;动作预测专家&amp;rsquo;拆成两个独立 Transformer，再用一张非对称注意力掩码管理二者的信息流：动作只看向当前帧，未来视频可以看动作。训练时联合优化两者学到世界动态，推理时直接跳过视频生成只跑动作分支——NAVSIM-v2 navhard/navtest 和 CityWalker 全面 SOTA，纯动作推理比带视频快 8 倍，还零样本部署到四足机器人。</description>
    </item>
    <item>
      <title>论文精读｜SimWAM：把世界模型当&#39;训练老师&#39;，用 Flow-GRPO 让 Action Expert 学会&#39;自己开车&#39;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/simwam%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/simwam%E7%B2%BE%E8%AF%BB/</guid>
      <description>SimWAM 用 joint flow matching 把预训练视频专家的交通动态先验&amp;rsquo;蒸馏&amp;rsquo;进轻量级 Action Expert，再用隔离注意力掩码让动作分支彻底摆脱未来帧依赖；随后把确定性 Flow ODE 转成可探索的 SDE，用 GRPO 直接优化 NAVSIM 组合驾驶奖励，突破模仿学习的上限。91.5 PDMS 新 SOTA，推理时延大幅低于 imagine-then-act 的 WAM，并零样本迁移到 nuScenes。</description>
    </item>
    <item>
      <title>JEPA 详解：LeCun 的联合嵌入预测架构与自动驾驶应用</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/jepa%E8%81%94%E5%90%88%E5%B5%8C%E5%85%A5%E9%A2%84%E6%B5%8B%E6%9E%B6%E6%9E%84%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/jepa%E8%81%94%E5%90%88%E5%B5%8C%E5%85%A5%E9%A2%84%E6%B5%8B%E6%9E%B6%E6%9E%84%E8%AF%A6%E8%A7%A3/</guid>
      <description>JEPA 是 Yann LeCun 提出的自监督表征学习框架，核心思想是在嵌入空间做预测而非重建像素，避免了对决策无关细节的浪费。它采用双编码器加预测器的架构，配合 EMA 目标编码器与 stop-gradient 机制实现稳定训练。在自动驾驶世界模型中已成为生成式方法的重要替代方案。</description>
    </item>
    <item>
      <title>驾驶数据标注与处理：从人工标注到自动化范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E9%A9%BE%E9%A9%B6%E6%95%B0%E6%8D%AE%E6%A0%87%E6%B3%A8%E4%B8%8E%E5%A4%84%E7%90%86/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E9%A9%BE%E9%A9%B6%E6%95%B0%E6%8D%AE%E6%A0%87%E6%B3%A8%E4%B8%8E%E5%A4%84%E7%90%86/</guid>
      <description>数据是自动驾驶系统的燃料。本文系统梳理 2D/3D/Temporal 标注的规范与工具，介绍自动标注（auto-labeling）、NeRF/3DGS 数据生成等前沿范式，覆盖 nuScenes、Waymo 等主流数据集和 corner case 挖掘策略。</description>
    </item>
    <item>
      <title>论文精读｜DiffusionDrive：扩散模型驱动的端到端轨迹规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusiondrive%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusiondrive%E7%B2%BE%E8%AF%BB/</guid>
      <description>DiffusionDrive 将扩散模型引入自动驾驶轨迹规划，从噪声出发逐步去噪生成多条合理轨迹，解决了确定性回归的 mode averaging 痛点。它通过轨迹初始化先验和截断扩散策略大幅减少采样步数，让扩散规划真正跑在车端。在闭环评测中达到生成式端到端驾驶的领先水平。</description>
    </item>
    <item>
      <title>AlpaSim 详解：面向强化学习的自动驾驶仿真评测框架</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/alpasim%E4%BB%BF%E7%9C%9F%E6%A1%86%E6%9E%B6%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/alpasim%E4%BB%BF%E7%9C%9F%E6%A1%86%E6%9E%B6%E8%AF%A6%E8%A7%A3/</guid>
      <description>AlpaSim 是一个面向强化学习训练与评测的自动驾驶仿真框架，支持闭环训练、多场景评测和安全验证。它采用微服务架构与神经渲染引擎 NRE，兼顾传感器保真度与横向可扩展性。是连接驾驶策略训练和部署验证的关键基础设施。</description>
    </item>
    <item>
      <title>多智能体交互决策：博弈论在自动驾驶中的应用</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%A4%9A%E6%99%BA%E8%83%BD%E4%BD%93%E4%BA%A4%E4%BA%92%E5%86%B3%E7%AD%96/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%A4%9A%E6%99%BA%E8%83%BD%E4%BD%93%E4%BA%A4%E4%BA%92%E5%86%B3%E7%AD%96/</guid>
      <description>自动驾驶并非独角戏，自车与其他交通参与者之间的交互博弈是最具挑战的决策问题。本文从博弈论基础（纳什均衡/Stackelberg博弈/势博弈）出发，讲解交互决策的核心挑战（部分可观测/意图不确定性/计算实时性），主流方法对比（基于规划的IV-game→基于学习的MADRL→基于模型的Gameformer），以及在换道博弈、无保护左转、环岛通行等典型场景中的应用实践。</description>
    </item>
    <item>
      <title>论文精读｜ReCogDrive：小米EV强化认知端到端自动驾驶框架</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/recogdrive%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/recogdrive%E7%B2%BE%E8%AF%BB/</guid>
      <description>华科×小米EV 提出 ReCogDrive，将 VLM 认知推理（场景理解与决策分析）、扩散规划器（连续轨迹生成）和 DiffGRPO 强化学习（安全优化）三阶段统一。它的层级化数据流水线自动生成含推理链的 VQA 标注，解决了 VLM&amp;rsquo;会想但不会开&amp;rsquo;的模态错配问题。在 NAVSIM 和 Bench2Drive 上达到 SOTA，验证了&amp;rsquo;认知-规划-优化&amp;rsquo;三分天下的 VLA 设计范式。</description>
    </item>
    <item>
      <title>模型部署入门详解：从 PyTorch 到车端推理</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%A8%A1%E5%9E%8B%E9%83%A8%E7%BD%B2%E5%85%A5%E9%97%A8%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%A8%A1%E5%9E%8B%E9%83%A8%E7%BD%B2%E5%85%A5%E9%97%A8%E8%AF%A6%E8%A7%A3/</guid>
      <description>模型部署是将训练好的深度学习模型转换、优化并部署到车端推理引擎的过程。本文讲解 ONNX/TensorRT 的核心概念、FP16/INT8 量化原理、VLA 大模型的边缘部署挑战，以及 Orin 等主流车端硬件的技术参数。</description>
    </item>
    <item>
      <title>论文精读｜Qwen-Drive-1.0：阿里通义首个驾驶视觉-语言基础模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/qwen-drive-1/</link>
      <pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/qwen-drive-1/</guid>
      <description>Qwen-Drive-1.0 基于 Qwen3.5-4B VLM 外挂两个模块：BEV感知头（3D检测+占用预测+地图分割）和 Planning Expert（~1.1B 参数 Flow Matching 轨迹生成器），四阶段渐进训练。关键设计：&lt;strong&gt;不设推理时打分器&lt;/strong&gt;，直接用 Flow Matching 单次采样输出轨迹，RL 后训练用 GRPO 式分组优势优化。NAVSIM v1.1 榜上 90.7 PDMS（RL），WOD-E2E 7.91 RFS，AlpaSim 闭环 0.37 分。</description>
    </item>
    <item>
      <title>论文精读｜LIBERO：面向终身机器人学习的知识迁移基准</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/libero%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/libero%E7%B2%BE%E8%AF%BB/</guid>
      <description>LIBERO 是首个面向终身决策学习（LLDM）的机器人操作基准，包含 130 个语言条件任务和 4 个任务套件。它系统研究了五种知识迁移场景下的策略架构、终身学习算法、任务顺序、预训练效果等关键问题。一个反直觉的发现：简单的顺序微调在正向迁移上反而优于 EWC、ER 等经典终身学习方法。</description>
    </item>
    <item>
      <title>论文精读｜SparseOccVLA：稀疏占用查询桥接 Occupancy 与 VLM，实现统一 4D 场景理解与规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/sparseoccvla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 27 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/sparseoccvla%E7%B2%BE%E8%AF%BB/</guid>
      <description>SparseOccVLA 用稀疏占用查询作为视觉与语言之间的单一桥梁，彻底摆脱 ViT patch token，让 LLM 在统一框架内同时完成场景理解、占用预测和轨迹规划。在 OmniDrive-nuScenes 上 CIDEr 提升 7%，Occ3D-nuScenes mIoU 提升 0.5，nuScenes 规划指标达 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜Qwen-VLA：阿里通义千问统一视觉-语言-动作基础模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/qwen-vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/qwen-vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>阿里 Qwen-VLA 用&amp;rsquo;认知主干+运动专家&amp;rsquo;双模块解耦架构（类比大脑皮层与小脑分工），将操作、导航、轨迹预测三类异构具身决策问题统一进同一模型。它采用 T2A→CPT→SFT→RL 四阶段渐进训练策略，稳定解决预训练 VLM 与随机初始化 DiT 动作解码器的不对称训练问题。在多机器人本体和多任务家族上展现一致跨任务性能与强分布外泛化。</description>
    </item>
    <item>
      <title>模型评估体系与回归检测：守护版本质量</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%A8%A1%E5%9E%8B%E8%AF%84%E4%BC%B0%E4%BD%93%E7%B3%BB%E4%B8%8E%E5%9B%9E%E5%BD%92%E6%A3%80%E6%B5%8B/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%A8%A1%E5%9E%8B%E8%AF%84%E4%BC%B0%E4%BD%93%E7%B3%BB%E4%B8%8E%E5%9B%9E%E5%BD%92%E6%A3%80%E6%B5%8B/</guid>
      <description>自动驾驶模型需要频繁迭代，但如何确保新版本&amp;rsquo;不比旧版本差&amp;rsquo;是一个被严重低估的工程难题。本文讲解模型回归检测的全套实践：离线评估Pipeline搭建（开环感知指标/闭环规划指标/计算延迟）、回归测试集的设计原则（场景覆盖/难度层级/对抗样本）、指标一致性分析（confidence interval/statistical significance/effect size）、以及CI/CD流水线中的自动化门禁机制（regression gate+人工review）。</description>
    </item>
    <item>
      <title>知识点拆解｜GRPO 强化学习方法详解：从 DeepSeek 到自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/grpo%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%96%B9%E6%B3%95%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/grpo%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%96%B9%E6%B3%95%E8%AF%A6%E8%A7%A3/</guid>
      <description>GRPO 用&amp;rsquo;组内相对优势&amp;rsquo;替代 PPO 的 critic 网络，大幅降低大模型强化学习的训练成本与显存开销。它通过对同一 prompt 采样一组回答并基于组内奖励均值做基线来实现策略优化。已在 DeepSeek-R1 及自动驾驶项目 AlphaDrive、Flow-GRPO 中成为首选 RL 算法。</description>
    </item>
    <item>
      <title>知识精讲｜ViT与视觉架构进化详解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/vit%E4%B8%8E%E8%A7%86%E8%A7%89%E6%9E%B6%E6%9E%84%E8%BF%9B%E5%8C%96%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/vit%E4%B8%8E%E8%A7%86%E8%A7%89%E6%9E%B6%E6%9E%84%E8%BF%9B%E5%8C%96%E8%AF%A6%E8%A7%A3/</guid>
      <description>从 ViT 到 ConvNeXt，视觉架构在 Transformer 与卷积之间完成了一个轮回。本文系统梳理 ViT 的核心机制（patch embedding、position encoding、class token），详解 DeiT、Swin、ConvNeXt 等关键演进，并分析多尺度特征金字塔与 VLA 视觉编码器的选型逻辑与缩放定律。</description>
    </item>
    <item>
      <title>论文精读｜CARLA: An Open Urban Driving Simulator —— 自动驾驶仿真的事实标准</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-1711-03938/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-1711-03938/</guid>
      <description>CARLA 是首个从头构建、开源开放的城市场景驾驶仿真器，基于 Unreal Engine 4 实现了高保真渲染、灵活传感器配置和标准化基准评测。本文从架构设计、实验基准到历史影响全面拆解这篇 CoRL 2017 经典论文，并分析其如何成为自动驾驶研究的事实标准平台。</description>
    </item>
    <item>
      <title>论文精读｜RT-1：Robotics Transformer——大规模真实机器人数据驱动的策略学习</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-1-robotics-transformer%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-1-robotics-transformer%E7%B2%BE%E8%AF%BB/</guid>
      <description>RT-1是Google Robotics团队提出的一种基于Transformer的机器人策略模型，通过在超过13万条真实机器人轨迹数据上训练，实现了对700+种任务的强大泛化能力。该工作首次证明了大规模、多样化的真实数据结合高容量架构能够在机器人领域取得类似NLP和CV领域的scalable性能。</description>
    </item>
    <item>
      <title>功能安全入门：ISO 26262与SOTIF</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%8A%9F%E8%83%BD%E5%AE%89%E5%85%A8%E5%85%A5%E9%97%A8/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%8A%9F%E8%83%BD%E5%AE%89%E5%85%A8%E5%85%A5%E9%97%A8/</guid>
      <description>L4自动驾驶的部署必须满足功能安全标准，但AI研究人员对此往往一片空白。本文从ISO 26262的ASIL等级与HARA分析出发，讲解功能安全的核心概念（故障/失效/危险/风险/安全目标/安全状态），再深入到SOTIF（ISO 21448）——专门针对自动驾驶&amp;rsquo;已知不安全场景&amp;rsquo;和&amp;rsquo;未知不安全场景&amp;rsquo;的安全分析框架。重点讨论VLA模型中感知不确定性量化、降级策略（degradation strategy）和安全监控（safety monitor）的工程实践。</description>
    </item>
    <item>
      <title>论文精读｜EMMA：Waymo的多模态端到端驾驶大模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/emma-wayve%E7%AB%AF%E5%88%B0%E7%AB%AF%E5%A4%9A%E6%A8%A1%E6%80%81%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/emma-wayve%E7%AB%AF%E5%88%B0%E7%AB%AF%E5%A4%9A%E6%A8%A1%E6%80%81%E7%B2%BE%E8%AF%BB/</guid>
      <description>Waymo 的 EMMA 基于 Gemini 多模态大模型，把所有驾驶任务（感知、预测、规划）统一翻译成自然语言 VQA，用单一模型、一套语言空间端到端处理。它选择直接文本化坐标以最大化复用 Gemini 预训练的世界知识。代表了将 MLLM 作为驾驶系统&amp;rsquo;一等公民&amp;rsquo;的前沿探索。</description>
    </item>
    <item>
      <title>知识点拆解｜PPO 算法深度拆解：从 Policy Gradient 到 GRPO 的进化之路</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/ppo%E7%AE%97%E6%B3%95%E6%B7%B1%E5%BA%A6%E6%8B%86%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/ppo%E7%AE%97%E6%B3%95%E6%B7%B1%E5%BA%A6%E6%8B%86%E8%A7%A3/</guid>
      <description>PPO 通过 clipped surrogate objective 和 GAE 实现稳定策略更新，是 RLHF 时代的核心算法。本文从 REINFORCE 出发，拆解 PPO 的每个关键组件，并对比 GRPO 的革新——去掉 critic，用组内相对优势替代。最后梳理 PPO/GRPO 在 VLA 驾驶模型（AlphaDrive、ReCogDrive、DriveVLA-W0）中的应用。</description>
    </item>
    <item>
      <title>知识点拆解｜VLM 视觉语言模型入门详解：从 CLIP 到 GPT-4V</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/vlm%E8%A7%86%E8%A7%89%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E5%85%A5%E9%97%A8%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/vlm%E8%A7%86%E8%A7%89%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E5%85%A5%E9%97%A8%E8%AF%A6%E8%A7%A3/</guid>
      <description>VLM（视觉语言模型）是 VLA 的视觉理解基础。本文从 CLIP 奠基到 GPT-4V/Gemini 前沿，系统梳理架构演进（ViT → Q-Former → LLM）、训练三阶段（对齐→指令微调→RLHF）及驾驶 VLM 的适配方案。</description>
    </item>
    <item>
      <title>知识点拆解｜自动驾驶强化学习中的 Reward 函数设计详解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E4%B8%ADreward%E8%AE%BE%E8%AE%A1%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E4%B8%ADreward%E8%AE%BE%E8%AE%A1%E8%AF%A6%E8%A7%A3/</guid>
      <description>Reward 函数决定了驾驶强化学习的性能天花板，必须在安全、舒适、合规、效率之间艰难权衡。本文系统拆解 reward 设计的四大组件（安全、舒适、合规、效率）、三大范式与常见陷阱。同时梳理了 NAVSIM、nuPlan 等评测指标如何反哺 reward 设计，为驾驶 RL 提供实操指南。</description>
    </item>
    <item>
      <title>知识精讲｜视觉基础模型在自动驾驶中的应用</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%A7%86%E8%A7%89%E5%9F%BA%E7%A1%80%E6%A8%A1%E5%9E%8B%E5%9C%A8%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%A7%86%E8%A7%89%E5%9F%BA%E7%A1%80%E6%A8%A1%E5%9E%8B%E5%9C%A8%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</guid>
      <description>DINOv2、SAM、Depth Anything、CLIP 等视觉基础模型正在深刻重塑自动驾驶的技术栈。本文详解它们各自的核心能力——自监督特征、可提示分割、单目深度估计、视觉-语言对齐——并分析在 VLA 和世界模型论文中作为冻结主干、教师模型和伪标签生成器的三种主要使用范式。</description>
    </item>
    <item>
      <title>论文精读｜PaLM-E：具身多模态语言模型——让机器人理解真实世界</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/palm-e%E5%85%B7%E8%BA%AB%E5%A4%9A%E6%A8%A1%E6%80%81%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/palm-e%E5%85%B7%E8%BA%AB%E5%A4%9A%E6%A8%A1%E6%80%81%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>PaLM-E是Google与柏林工业大学联合提出的具身多模态语言模型，将PaLM大语言模型与视觉编码器结合，直接处理机器人传感器数据。该模型在562B参数规模下不仅在机器人任务上表现出色，还在OK-VQA等视觉语言基准上达到SOTA，同时保留了强大的语言能力。</description>
    </item>
    <item>
      <title>NVIDIA DRIVE平台详解：从Orin到Thor</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/nvidia-drive%E5%B9%B3%E5%8F%B0%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/nvidia-drive%E5%B9%B3%E5%8F%B0%E8%AF%A6%E8%A7%A3/</guid>
      <description>NVIDIA DRIVE是自动驾驶行业最主流的车端计算平台，从Orin（254 TOPS）到Thor（2000 TOPS）的演进正在重新定义VLA模型的部署边界。本文从硬件架构出发，讲解Orin/Thor的GPU-CPU-DLA-PVA异构计算单元、内存带宽与瓶颈分析、DRIVE OS与DriveWorks中间件栈、TensorRT在DRIVE上的优化策略（INT8稀疏化/DLA offloading/Multi-Stream调度），以及实际部署VLA模型时的pipeline编排与延迟预算分配经验。</description>
    </item>
    <item>
      <title>论文精读｜GoalFlow：目标引导流匹配轨迹生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/goalflow%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/goalflow%E7%B2%BE%E8%AF%BB/</guid>
      <description>GoalFlow 用一个精准目标点词表加评分机制选出最合理的短期终点，再用 Flow Matching 一步生成多模态驾驶轨迹。它解决了纯扩散生成轨迹发散无边界、而固定锚点约束过强不真实的两难问题。在 NAVSIM 上 PDMS 达到 90.3，验证了&amp;rsquo;目标点+整流流&amp;rsquo;高效生成方案的有效性。</description>
    </item>
    <item>
      <title>知识点拆解｜大语言模型基础详解：Transformer、MoE 与 Scaling Law</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%A4%A7%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%A4%A7%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</guid>
      <description>LLM 是 VLA 的&amp;rsquo;大脑&amp;rsquo;，提供推理与常识能力。本文深入 Transformer decoder 架构（因果注意力、KV Cache、RoPE、SwiGLU、GQA）、MoE（DeepSeek-V3 风格）、Scaling Laws 以及 VLA 中常用的 LLM 系列（Qwen-2.5、InternLM、Llama-3）。</description>
    </item>
    <item>
      <title>知识点拆解｜离线强化学习详解：从 CQL、IQL 到自动驾驶 VLA</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%A6%BB%E7%BA%BF%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%A6%BB%E7%BA%BF%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E8%AF%A6%E8%A7%A3/</guid>
      <description>离线 RL 让智能体从静态数据集中学习，无需在线交互，对自动驾驶等安全关键领域至关重要。本文详解 CQL、IQL、TD3+BC 等核心算法，讨论分布偏移与 OOD 动作问题，并梳理离线预训练→在线微调范式在 VLA 驾驶模型中的应用与趋势。</description>
    </item>
    <item>
      <title>知识点拆解｜自动驾驶轨迹规划基础</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%BD%A8%E8%BF%B9%E8%A7%84%E5%88%92%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%BD%A8%E8%BF%B9%E8%A7%84%E5%88%92%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</guid>
      <description>轨迹规划是自动驾驶系统中连接预测与控制的枢纽，其核心任务是在安全、舒适、可行的约束下生成时空轨迹。本文深入讲解 Frenet 坐标系、主流轨迹规划算法分类、碰撞检测与轨迹平滑等核心概念。帮助读者建立从数学基础到工程实践的完整知识框架。</description>
    </item>
    <item>
      <title>知识精讲｜3D目标检测全景详解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/3d%E7%9B%AE%E6%A0%87%E6%A3%80%E6%B5%8B%E5%85%A8%E6%99%AF%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/3d%E7%9B%AE%E6%A0%87%E6%A3%80%E6%B5%8B%E5%85%A8%E6%99%AF%E8%AF%A6%E8%A7%A3/</guid>
      <description>3D 目标检测是自动驾驶感知的核心任务之一。本文从 2D 检测到 3D 检测的额外挑战出发，系统梳理纯视觉、纯 LiDAR 和多传感器融合三大技术路线，分析 DETR3D、BEVFormer、PointPillars、BEVFusion 等代表方法，并探讨在端到端趋势下 3D 检测逐渐被规划吸收的范式转变。</description>
    </item>
    <item>
      <title>论文精读｜SayCan：让大型语言模型在机器人上落地执行</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/saycan%E8%AF%AD%E8%A8%80-grounding%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/saycan%E8%AF%AD%E8%A8%80-grounding%E7%B2%BE%E8%AF%BB/</guid>
      <description>SayCan是Google提出的将大型语言模型与机器人技能结合的方法，通过将LLM的语言知识与机器人技能的可行性（affordance）结合，实现了自然语言指令到长horizon机器人任务的规划与执行。该工作首次展示了LLM如何在真实机器人上落地，开启了LLM+机器人的新范式。</description>
    </item>
    <item>
      <title>论文精读｜VAD：向量化端到端自动驾驶的效率革命</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vad%E5%90%91%E9%87%8F%E5%8C%96%E7%AB%AF%E5%88%B0%E7%AB%AF%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vad%E5%90%91%E9%87%8F%E5%8C%96%E7%AB%AF%E5%88%B0%E7%AB%AF%E7%B2%BE%E8%AF%BB/</guid>
      <description>VAD 将整个驾驶场景建模为全向量化表示——地图元素和 agent 运动都变成矢量，彻底抛弃了 UniAD 中的稠密栅格。它通过隐式 query 交互和显式三个向量化规划约束，在保持精度的同时将推理速度提升 2.5-9.3 倍。作为 UniAD 之后最重要的效率改进工作，VAD 为端到端驾驶的实时部署铺平了道路。</description>
    </item>
    <item>
      <title>知识点拆解｜RLHF 与偏好对齐详解：从大模型到自动驾驶驾驶风格学习</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/rlhf%E4%B8%8E%E5%81%8F%E5%A5%BD%E5%AF%B9%E9%BD%90%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/rlhf%E4%B8%8E%E5%81%8F%E5%A5%BD%E5%AF%B9%E9%BD%90%E8%AF%A6%E8%A7%A3/</guid>
      <description>RLHF 通过人类偏好反馈将模型行为对齐到人类期望。本文详解 RLHF 三阶段流程、Bradley-Terry 奖励模型、DPO 直接偏好优化，并分析 GRPO 如何避免显式 reward 建模。在驾驶场景中，偏好对齐天然适配&amp;rsquo;不同人有不同驾驶风格&amp;rsquo;这一人类直觉——有人偏好激进、有人偏好保守，RLHF 让 VLA 模型学会按需生成驾驶行为。</description>
    </item>
    <item>
      <title>知识点拆解｜多模态对齐与指令微调详解：从 VLM 到 VLA 的关键桥梁</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%A4%9A%E6%A8%A1%E6%80%81%E5%AF%B9%E9%BD%90%E4%B8%8E%E6%8C%87%E4%BB%A4%E5%BE%AE%E8%B0%83%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%A4%9A%E6%A8%A1%E6%80%81%E5%AF%B9%E9%BD%90%E4%B8%8E%E6%8C%87%E4%BB%A4%E5%BE%AE%E8%B0%83%E8%AF%A6%E8%A7%A3/</guid>
      <description>多模态对齐是 VLA 的&amp;rsquo;关键桥梁&amp;rsquo;——它决定视觉信号能否被 LLM 正确理解。本文梳理从对比损失（CLIP）到 Q-Former（BLIP-2）到 MLP 投影（LLaVA）的对齐方案演进，以及 VLA 如何将对齐从&amp;rsquo;图像→文本&amp;rsquo;扩展到&amp;rsquo;图像→动作&amp;rsquo;，详解连续动作的 tokenization 策略。</description>
    </item>
    <item>
      <title>知识点拆解｜强化学习基础：从MDP到PPO</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</guid>
      <description>强化学习通过试错交互自主优化策略，是继监督学习之后最具潜力的自动驾驶训练范式。本文从 MDP 五元组出发，系统讲解策略梯度、PPO/SAC/DDPG 等主流 RL 算法的数学原理与演进脉络。并深入分析各算法在自动驾驶决策与规划中的适用场景与落地挑战。</description>
    </item>
    <item>
      <title>知识点拆解｜运动预测与行为预测基础</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%BF%90%E5%8A%A8%E9%A2%84%E6%B5%8B%E4%B8%8E%E8%A1%8C%E4%B8%BA%E9%A2%84%E6%B5%8B%E5%9F%BA%E7%A1%80/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%BF%90%E5%8A%A8%E9%A2%84%E6%B5%8B%E4%B8%8E%E8%A1%8C%E4%B8%BA%E9%A2%84%E6%B5%8B%E5%9F%BA%E7%A1%80/</guid>
      <description>运动预测与行为预测是自动驾驶系统理解周围交通参与者的核心技术，其目标是从历史观测中推断其他车辆、行人、骑行者的未来轨迹。本文从问题定义出发，系统梳理输入输出范式、经典架构、多智能体预测、目标条件预测以及评分机制，并分析预测模块在端到端框架中的演进趋势。</description>
    </item>
    <item>
      <title>知识精讲｜Occupancy网络详解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/occupancy%E7%BD%91%E7%BB%9C%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/occupancy%E7%BD%91%E7%BB%9C%E8%AF%A6%E8%A7%A3/</guid>
      <description>Occupancy 网络通过稠密的 3D 体素网格表示场景，突破了 3D 目标检测对“物体”范畴的限制，可表征任意形状的障碍物与自由空间。本文详解其与检测的差异、OccFormer/FlashOcc/OpenOccupancy 等代表架构，以及在 NIFF 等世界模型中 occupancy 如何作为核心场景表示驱动未来预测与规划决策。</description>
    </item>
    <item>
      <title>论文精读｜Gato：DeepMind的通用智能体——一个网络玩转604种任务</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/gato%E9%80%9A%E7%94%A8%E6%99%BA%E8%83%BD%E4%BD%93%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/gato%E9%80%9A%E7%94%A8%E6%99%BA%E8%83%BD%E4%BD%93%E7%B2%BE%E8%AF%BB/</guid>
      <description>Gato是DeepMind提出的通用智能体，通过在604种不同任务上联合训练，用一个Transformer网络同时处理 Atari 游戏、机器人控制、图像描述、文本对话等任务。它证明了单一模型可以掌握多种模态的技能，是迈向通用人工智能的重要一步。</description>
    </item>
    <item>
      <title>论文精读｜DriveVLM-W0 与 DriveWLM 系列：世界模型如何点亮驾驶大模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevlm-w0%E4%B8%8Edrivewlm%E7%B3%BB%E5%88%97%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevlm-w0%E4%B8%8Edrivewlm%E7%B3%BB%E5%88%97%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveVLM 家族从语言 CoT 演进到世界模型统一建模范式，攻克了 VLM 上车面临的监督稀疏、世界与动作割裂、探索不安全三道坎。DrivingGPT 用 VQ-VAE 把图像与动作离散化为统一词表，将驾驶建模为 next-token 预测。DriveVLM-RL 借鉴神经科学双通路机制，用离线 RL 为驾驶安全兜底。</description>
    </item>
    <item>
      <title>知识点拆解｜Chain-of-Thought 推理详解：让 VLA 学会&#39;先思考再行动&#39;</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/chain-of-thought%E6%8E%A8%E7%90%86%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/chain-of-thought%E6%8E%A8%E7%90%86%E8%AF%A6%E8%A7%A3/</guid>
      <description>CoT（思维链）让 VLA &amp;lsquo;想清楚再做&amp;rsquo;，将驾驶决策过程拆解为可解释的推理步骤。本文从 CoT 基础（Few-shot / Zero-shot / Self-consistency）出发，详解 DriveVLM 的场景描述→预测→推理→规划四阶段 CoT、WCog-VLA 的博弈论 Game-CoT、视觉 DCoT，以及 GRPO + CoT 联合训练的 AlphaDrive 范式。</description>
    </item>
    <item>
      <title>知识点拆解｜Scoring-based 规划范式详解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/scoring-based%E8%A7%84%E5%88%92%E8%8C%83%E5%BC%8F%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/scoring-based%E8%A7%84%E5%88%92%E8%8C%83%E5%BC%8F%E8%AF%A6%E8%A7%A3/</guid>
      <description>Scoring-based 规划范式是当前端到端自动驾驶规划的主流方法论之一，其核心思想是：先生成多个候选轨迹，再通过学习一个评分网络选出最优轨迹。本文系统性梳理从 BC 回归到多模态评分、扩散采样到强化学习的方法演进，详细解析 Vocabulary-based、动态生成、扩散三类核心范式，并深入 ScoreNet 的设计哲学与关键论文脉络。</description>
    </item>
    <item>
      <title>知识点拆解｜扩散模型基础：从DDPM到条件生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</guid>
      <description>扩散模型通过逐步加噪与逆向去噪实现从纯噪声到高质量数据的生成，已成为 GAN 之后最强大的生成范式。本文从 DDPM 的数学推导出发，详细讲解正向加噪过程、反向去噪网络以及条件生成方法。同时梳理了扩散模型在自动驾驶场景生成、轨迹规划中的数据增强应用全景。</description>
    </item>
    <item>
      <title>知识点拆解｜逆强化学习详解：从专家演示中学会&#39;为什么这么开&#39;</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E9%80%86%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E9%80%86%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E8%AF%A6%E8%A7%A3/</guid>
      <description>逆强化学习（IRL）解决的是&amp;rsquo;从行为反推动机&amp;rsquo;的问题——给定专家演示，推断 driving force 背后的 reward 函数。本文详解最大熵 IRL、GAIL/AIRL 对抗方法，阐明 IRL 与 BC、RL 的本质区别，并梳理 IRL 在自动驾驶中的应用：从人类驾驶数据中学习 reward，再用 RL 优化策略。最后讨论偏好 IRL 和 VLM 作为 reward 的最新趋势。</description>
    </item>
    <item>
      <title>论文精读｜Open X-Embodiment：跨机器人大规模数据集与RT-X模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/open-x-embodiment%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/open-x-embodiment%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>Open X-Embodiment是Google联合21家机构打造的跨机器人大规模数据集，包含22种机器人、100万+轨迹数据。基于该数据集训练的RT-X模型首次证明了跨机器人正迁移的可行性，RT-1-X成功率提升50%，RT-2-X泛化能力提升3倍。</description>
    </item>
    <item>
      <title>论文精读｜Diffusion Planner：把轨迹规划重定义为扩散式未来生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-planner%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-planner%E7%B2%BE%E8%AF%BB/</guid>
      <description>Diffusion Planner 把自动驾驶规划重定义为未来轨迹生成任务，用 Diffusion Transformer（DiT）将自车规划与他车预测联合建模为一次条件去噪过程。它通过免训练的分类器引导机制在推理时灵活注入安全、舒适与速度偏好。在 nuPlan 闭环评测中刷新 SOTA，开创了扩散式联合预测-规划的新范式。</description>
    </item>
    <item>
      <title>知识点拆解｜Transformer与注意力机制基础</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/transformer%E4%B8%8E%E6%B3%A8%E6%84%8F%E5%8A%9B%E6%9C%BA%E5%88%B6%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/transformer%E4%B8%8E%E6%B3%A8%E6%84%8F%E5%8A%9B%E6%9C%BA%E5%88%B6%E8%AF%A6%E8%A7%A3/</guid>
      <description>Transformer 凭借自注意力机制的长程依赖建模与并行计算能力，从 NLP 席卷至自动驾驶全栈。本文从缩放点积注意力的数学原理出发，系统梳理 Multi-Head Attention、ViT、BEVFormer 及 VLM 中 Causal Attention 的关键技术。为理解 Transformer 在自动驾驶感知与规划中的应用奠定理论基础。</description>
    </item>
    <item>
      <title>知识点拆解｜控制基础与车辆动力学</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%8E%A7%E5%88%B6%E5%9F%BA%E7%A1%80%E4%B8%8E%E8%BD%A6%E8%BE%86%E5%8A%A8%E5%8A%9B%E5%AD%A6/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%8E%A7%E5%88%B6%E5%9F%BA%E7%A1%80%E4%B8%8E%E8%BD%A6%E8%BE%86%E5%8A%A8%E5%8A%9B%E5%AD%A6/</guid>
      <description>控制模块是自动驾驶系统中连接规划与车辆执行器的关键桥梁。本文深入讲解车辆运动学与动力学基础模型、经典控制方法（PID、LQR、MPC）、轨迹跟踪算法、以及车辆动力学中的关键物理概念。同时分析端到端自动驾驶中控制角色的转变——从传统控制到&amp;rsquo;waypoint 直接输出&amp;rsquo;再到&amp;rsquo;action chunking&amp;rsquo;的演进逻辑。</description>
    </item>
    <item>
      <title>论文精读｜DROID：大规模真实世界机器人操作数据集</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/droid%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%93%8D%E4%BD%9C%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/droid%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%93%8D%E4%BD%9C%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>DROID是Google联合18家机构打造的大规模真实世界机器人操作数据集，包含76k演示轨迹、564个场景、86个任务，跨越北美、亚洲、欧洲三大洲。实验证明使用DROID训练的策略在性能和泛化能力上平均提升20%。</description>
    </item>
    <item>
      <title>论文精读｜MAN TruckScenes — 第一个面向重卡自动驾驶的多模态数据集，把 4D 雷达做成 360° 全覆盖</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-mantruckscenes/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-mantruckscenes/</guid>
      <description>MAN TruckScenes 是 MAN Truck &amp;amp; Bus 与慕尼黑工业大学在 NeurIPS 2024 Datasets &amp;amp; Benchmarks 提出的第一个面向自动驾驶重卡的多模态数据集，含 747 个 20 秒场景、4 相机 + 6 激光雷达 + 6 个 4D 雷达 + 双 IMU + 高精度 GNSS，标注范围超 230 米、27 个物体类、34 个场景标签，并首次提供 360° 覆盖的 4D 雷达点云与带 3D 框标注，配套 nuScenes 格式 devkit 与 CenterPoint/RadarGNN/PETR 基线。本文面向刚入行的 VLA 工程师，用大白话拆解它的传感器布局、卡车特有挑战、标注与切分、以及给端到端重卡模型带来的长距离鲁棒感知问题。</description>
    </item>
    <item>
      <title>论文精读｜AlphaDrive：GRPO 强化学习唤醒驾驶推理与多模态规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/alphadrive-grpo%E9%A9%BE%E9%A9%B6%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/alphadrive-grpo%E9%A9%BE%E9%A9%B6%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>AlphaDrive 把 DeepSeek R1 式的 GRPO 推理强化学习首次引入自动驾驶规划，将高层驾驶决策建模为元动作分类问题。它设计了四个面向规划的专门奖励，配合 SFT 预热+RL 探索两阶段策略。仅 2B 参数的 Qwen2VL 模型反超 7B 系列，并涌现出&amp;rsquo;一景多解&amp;rsquo;的多模态规划能力。</description>
    </item>
    <item>
      <title>知识点拆解｜自动驾驶安全机制详解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E5%AE%89%E5%85%A8%E6%9C%BA%E5%88%B6%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E5%AE%89%E5%85%A8%E6%9C%BA%E5%88%B6%E8%AF%A6%E8%A7%A3/</guid>
      <description>安全是自动驾驶系统的第一性原则。本文系统梳理端到端自动驾驶中的安全机制设计，涵盖碰撞检测与避障、可行驶区域约束、规则安全过滤器、损失函数中的安全项、安全世界模型、主动安全 ADAS 系统及功能安全标准等核心内容。帮助读者构建从算法安全到系统安全的完整认知框架。</description>
    </item>
    <item>
      <title>知识点拆解｜自动驾驶传感器与多模态融合基础</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%BC%A0%E6%84%9F%E5%99%A8%E4%B8%8E%E8%9E%8D%E5%90%88%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E4%BC%A0%E6%84%9F%E5%99%A8%E4%B8%8E%E8%9E%8D%E5%90%88%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</guid>
      <description>自动驾驶依赖多传感器融合来克服单一传感器在弱光、雨雪等场景下的能力边界。本文系统对比摄像头、激光雷达、毫米波雷达等主流传感器的原理与优劣，深入讲解时空同步与多模态融合策略。最后阐述 BEV 作为统一表示空间如何串联感知全链路。</description>
    </item>
    <item>
      <title>论文精读｜RH20T：面向拟人全身控制的机器人操作数据集</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rh20t%E6%8B%9F%E4%BA%BA%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rh20t%E6%8B%9F%E4%BA%BA%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>RH20T是上海交通大学推出的超大规模机器人操作数据集，包含110,000+条接触丰富的真实世界操作序列，覆盖147项任务、7种机器人配置。数据集提供视觉、力觉、音频等多模态信息，支持一次性模仿学习研究。</description>
    </item>
    <item>
      <title>论文精读｜Sparse4D：全稀疏多摄像头 3D 感知的三连击</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/sparse4d%E7%A8%80%E7%96%8F%E6%84%9F%E7%9F%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/sparse4d%E7%A8%80%E7%96%8F%E6%84%9F%E7%9F%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>Sparse4D 用全稀疏范式挑战 BEV 感知路线：用稀疏实例 query 直接从多相机图像抠出 3D 目标，绕开计算昂贵的稠密 BEV 特征图。它通过稀疏 4D 关键点采样、循环时序融合和实例去噪三项核心设计，将多摄像头 3D 检测与跟踪做到 nuScenes 顶尖。作为全稀疏感知范式奠基作，后续 SparseDrive 系列在此基础上构建端到端驾驶系统。</description>
    </item>
    <item>
      <title>知识点拆解｜视频生成模型基础详解：VQVAE、扩散模型与DiT</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%A7%86%E9%A2%91%E7%94%9F%E6%88%90%E6%A8%A1%E5%9E%8B%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%A7%86%E9%A2%91%E7%94%9F%E6%88%90%E6%A8%A1%E5%9E%8B%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</guid>
      <description>视频生成模型是自动驾驶世界模型的核心技术基础。本文从 VQVAE 的离散潜在表征出发，逐步讲解扩散模型从像素到潜在空间的演进、DiT 架构的 Scaling 特性、因果 VAE 在时序建模中的作用，以及驾驶场景下的多相机视频生成方法全景。</description>
    </item>
    <item>
      <title>论文精读｜Octo：开源通用机器人策略——大规模多任务机器人基础模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/octo%E9%80%9A%E7%94%A8%E6%9C%BA%E5%99%A8%E4%BA%BA%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/octo%E9%80%9A%E7%94%A8%E6%9C%BA%E5%99%A8%E4%BA%BA%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>Octo 是 UC Berkeley 等团队推出的开源通用机器人策略（GRP），基于 Transformer 架构在 80 万条多机器人轨迹上预训练，支持语言指令和目标图像双模式输入，可通过高效微调适配新机器人平台和动作空间。作为首个完全开源的通用机器人操控策略，Octo 为机器人基础模型的研究奠定了重要基础。</description>
    </item>
    <item>
      <title>论文精读｜Last-VLA：小米的视觉-语言-动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/last-vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/last-vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>LaST-VLA 把 VLA 推理从文字 CoT 搬进连续隐空间，用 3D 几何先验（VGGT）和世界模型动力学先验（Cosmos）两个外部基础模型当特征级老师，蒸馏监督隐 CoT。它让隐式推理既绕开了文字 CoT 的慢速与幻觉问题，又避免了朴素隐 CoT 的物理脱节。在 NAVSIM 双榜单上用单目前视传感器取得 SOTA，推理时两个老师全部旁路、零额外开销。</description>
    </item>
    <item>
      <title>知识点拆解｜驾驶世界模型全景详解：分类、代表工作与发展脉络</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E9%A9%BE%E9%A9%B6%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E5%85%A8%E6%99%AF%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E9%A9%BE%E9%A9%B6%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E5%85%A8%E6%99%AF%E8%AF%A6%E8%A7%A3/</guid>
      <description>世界模型从预测空间维度可分为像素空间、潜在空间和占用空间三大类别，每种都有不同的代表方法与适用场景。本文系统梳理了 DriveDreamer、GAIA-1、Vista、World4Drive、OccWorld 等主流世界模型，对比其核心技术、条件控制与对规划的支持能力，并给出完整的分类体系与发展脉络。</description>
    </item>
    <item>
      <title>论文精读｜OpenVLA：开源视觉-语言-动作模型——VLA走向开放生态</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/openvla%E5%BC%80%E6%BA%90vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/openvla%E5%BC%80%E6%BA%90vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型，在 97 万条真实机器人演示上训练，以 7 倍更少的参数超越闭源模型 RT-2-X（55B）。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干，结合 LoRA 微调和量化推理，OpenVLA 让 VLA 模型首次走向开放生态。</description>
    </item>
    <item>
      <title>论文精读｜One-VL：小米统一视觉语言模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/one-vl%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/one-vl%E7%B2%BE%E8%AF%BB/</guid>
      <description>小米 OneVL 用双模态隐式推理超越显式 CoT，攻克了隐式推理长期打不过显式 CoT 的困境。它将 55 个紧致隐 token（35 视觉+20 语言）作为信息瓶颈，用语言解码器还原语义 CoT、视觉世界模型解码器预测未来帧，双管齐下将隐空间钉死在因果关系上。推理时所有隐 token 一步 prefill，延迟与直接出答案持平，4B 模型在四大基准全 SOTA。</description>
    </item>
    <item>
      <title>知识点拆解｜条件扩散模型详解：引导方法与条件注入技术</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%9D%A1%E4%BB%B6%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%9D%A1%E4%BB%B6%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B%E8%AF%A6%E8%A7%A3/</guid>
      <description>条件生成是扩散模型落地的关键能力，涉及如何将文本、图像、深度图、驾驶命令等条件信息注入生成过程。本文深入讲解 Classifier-Free Guidance 与 Classifier Guidance 的数学原理、条件注入的四种技术方案、驾驶场景中的多模态条件设计，以及截断扩散和 Flow Matching 等加速方案。</description>
    </item>
    <item>
      <title>论文精读｜DreamerV3：通过世界模型掌握多样领域——通用强化学习智能体</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/dreamerv3%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/dreamerv3%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>DreamerV3 是 DeepMind 提出的通用强化学习算法，通过学习世界模型并在想象中规划，以单一固定超参数配置在 150 多个多样化任务上超越专用算法。首次从零开始在 Minecraft 中收集钻石，标志着强化学习向通用化迈出了重要一步。</description>
    </item>
    <item>
      <title>论文精读｜Senna：用 VLM 给端到端驾驶装上&#39;大脑&#39;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/senna-vlm%E8%BE%85%E5%8A%A9%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/senna-vlm%E8%BE%85%E5%8A%A9%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</guid>
      <description>Senna 将大型视觉语言模型（Senna-VLM）与端到端规划器（Senna-E2E）解耦协同，VLM 用自然语言输出高层决策，E2E 在该决策条件下生成精确轨迹。它巧妙绕开了 LVLM 不擅长数值预测的软肋，让 VLM 干&amp;rsquo;说人话做决策&amp;rsquo;、E2E 干&amp;rsquo;算轨迹画路点&amp;rsquo;。这条 VLM 辅助端到端驾驶的路线成为后续多个工作的设计原型。</description>
    </item>
    <item>
      <title>知识点拆解｜Flow Matching 与扩散模型统一视角：从 SDE 到 ODE 的生成范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/flow-matching%E4%B8%8E%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B%E7%BB%9F%E4%B8%80%E8%A7%86%E8%A7%92/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/flow-matching%E4%B8%8E%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B%E7%BB%9F%E4%B8%80%E8%A7%86%E8%A7%92/</guid>
      <description>扩散模型与 Flow Matching 是当前生成式 AI 的两大核心范式。本文从 SDE 与 ODE 的统一视角出发，深入讲解扩散模型的随机微分方程解释、Flow Matching 的向量场学习方法、Rectified Flow 的路径整流机制，揭示扩散是 Flow Matching 的特殊情况。同时总结两者在自动驾驶场景生成与轨迹规划中的应用对比。</description>
    </item>
    <item>
      <title>论文精读｜UniSim：学习交互式真实世界模拟器——生成式世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/unisim%E4%BA%A4%E4%BA%92%E5%BC%8F%E4%B8%96%E7%95%8C%E6%A8%A1%E6%8B%9F%E5%99%A8%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/unisim%E4%BA%A4%E4%BA%92%E5%BC%8F%E4%B8%96%E7%95%8C%E6%A8%A1%E6%8B%9F%E5%99%A8%E7%B2%BE%E8%AF%BB/</guid>
      <description>UniSim 是由 Google DeepMind、UC Berkeley 和 MIT 联合提出的通用真实世界模拟器，通过生成式建模将互联网图像、机器人操作、人类活动等异构数据统一到一个动作输入-视频输出的框架中。该模型能够模拟从高层语言指令到低层机器人控制的各种交互，在视觉-语言规划、强化学习和视频描述等任务上实现了零样本真实世界迁移。</description>
    </item>
    <item>
      <title>论文精读｜Gen-Drive：扩散模型生成 &#43; 强化学习精调的驾驶策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/gen-drive%E6%89%A9%E6%95%A3%E5%BC%BA%E5%8C%96%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/gen-drive%E6%89%A9%E6%95%A3%E5%BC%BA%E5%8C%96%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</guid>
      <description>Gen-Drive 把自动驾驶规划从&amp;rsquo;预测-规划&amp;rsquo;重构为&amp;rsquo;生成-评估&amp;rsquo;范式：行为扩散模型生成多样未来场景，学习型场景评估器（VLM 辅助训练）打分，再用 RL 微调扩散策略向高分方向优化。它创造性地将 RLHF 奖励建模思路搬进驾驶领域，验证了学习型 reward 优于人工设计。在闭环评测中展现了生成式+强化学习融合的潜力。</description>
    </item>
    <item>
      <title>论文精读｜EmbodiedGPT：基于具身思维链的视觉-语言预训练</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/embodiedgpt%E5%85%B7%E8%BA%AB%E6%80%9D%E7%BB%B4%E9%93%BE%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/embodiedgpt%E5%85%B7%E8%BA%AB%E6%80%9D%E7%BB%B4%E9%93%BE%E7%B2%BE%E8%AF%BB/</guid>
      <description>EmbodiedGPT 是由中国科学院上海AI实验室、香港大学等机构提出的端到端多模态具身基础模型，通过创新的&amp;rsquo;具身思维链&amp;rsquo;（Embodied Chain of Thought）范式，将视觉-语言预训练与具身规划紧密结合。该模型构建了大规模EgoCOT数据集，实现了从高层规划到低层控制的闭环系统，在具身规划、控制、视频描述和视觉问答等多个任务上取得了优异性能。</description>
    </item>
    <item>
      <title>论文精读｜BEVFormer：时空 Transformer 玩转多摄像头 BEV 感知</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/bevformer%E6%84%9F%E7%9F%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/bevformer%E6%84%9F%E7%9F%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>BEVFormer 开创了基于可学习 BEV queries 的时空 Transformer 感知范式，用空间交叉注意力从多视图图像采样特征、用时间自注意力沿时序聚合信息。它纯靠多摄像头就在 nuScenes 上达到 56.9% NDS 逼近 LiDAR 基线。此后几乎所有端到端驾驶方案都沿用其 BEV query+时序融合的基本设计。</description>
    </item>
    <item>
      <title>论文精读｜VIMA：基于多模态提示的通用机器人操作——多模态大模型驱动机器人</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vima-multimodal-prompts-robot-manipulation/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vima-multimodal-prompts-robot-manipulation/</guid>
      <description>VIMA提出了一种统一的多模态提示接口，将多样化的机器人操作任务转化为序列建模问题。通过Transformer编码器-解码器架构和物体中心表示，VIMA在零样本泛化设置下任务成功率最高提升2.9倍。</description>
    </item>
    <item>
      <title>论文精读｜DriveDreamer：构建真实驾驶场景的世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivedreamer%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivedreamer%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveDreamer 是首个完全从真实驾驶数据构建的自动驾驶世界模型。它用扩散模型配合 ControlNet 机制处理 HDMap、3D 框、文本和动作等多模态结构化条件，通过两阶段训练同时实现可控驾驶视频生成与未来动作预测。作为驾驶世界模型的奠基之作，它开创了从真实场景理解到未来预测的统一范式。</description>
    </item>
    <item>
      <title>论文精读｜MOO：基于预训练视觉-语言模型的开放世界物体操作</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/moo-open-world-object-manipulation/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/moo-open-world-object-manipulation/</guid>
      <description>MOO利用预训练视觉-语言模型将自然语言指令与视觉物体定位相结合，实现了对从未见过的物体类别的零样本操作泛化，在真实机器人上达到约79%的成功率。</description>
    </item>
    <item>
      <title>论文精读｜A Survey of World Models for Autonomous Driving：自动驾驶世界模型全景综述</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2501-11260/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2501-11260/</guid>
      <description>这篇持续更新的综述为自动驾驶世界模型构建了一套三层分类法：Tier I 生成未来物理世界（Image/BEV/OG/PC 四类生成范式）、Tier II 智能体行为规划（规则与学习双轨）、Tier III 预测与规划交互。它系统梳理了自监督学习、多模态预训练、生成式数据增强等训练范式，并配套发布 WMAD 论文清单与基准。是当前入门自动驾驶世界模型最系统的地图。</description>
    </item>
    <item>
      <title>论文精读｜LeRobot：让机器人学习触手可及——HuggingFace的开源机器人学习框架</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/lerobot-open-source-robot-learning/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/lerobot-open-source-robot-learning/</guid>
      <description>LeRobot是HuggingFace推出的开源机器人学习库，覆盖从底层电机控制到大规模数据集收集、存储和流式传输的完整栈，支持多种低成本机器人平台和SOTA学习算法。截至2025年9月，社区已贡献16K+数据集和数百个预训练模型，形成了去中心化的机器人数据收集生态。</description>
    </item>
    <item>
      <title>论文精读｜SafeDiffuser：用控制障碍函数给扩散规划加上安全保证</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2306-00148/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2306-00148/</guid>
      <description>SafeDiffuser 把控制论中的控制障碍函数（CBF）改造为有限时间扩散不变性，嵌入扩散去噪的每一步，为数据驱动的扩散规划器提供可证明的安全保证。它解决了扩散概率采样可能越界、约束只能&amp;rsquo;软学&amp;rsquo;、采样即赌博三大安全隐患。在迷宫、足式机器人、机械臂操作上验证了安全性与生成质量的兼得。</description>
    </item>
    <item>
      <title>论文精读｜具身智能VLA模型综述：从视觉-语言到动作生成的技术全景</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vla-survey-2024/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vla-survey-2024/</guid>
      <description>首篇系统性综述视觉-语言-动作（VLA）模型的文章，从组件、控制策略和任务规划三个维度全面梳理了VLA模型的技术脉络，涵盖CLIP/R3M/DINOv2等视觉表征、RT-1/RT-2/OpenVLA等控制策略、SayCan/Code as Policies等任务规划方法，并深入探讨了安全、数据集、基础模型等挑战与未来方向。</description>
    </item>
    <item>
      <title>论文精读｜MVAdapt：零样本多车型适应的端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-11854/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-11854/</guid>
      <description>MVAdapt 揭示了端到端自动驾驶的&amp;rsquo;车辆域差距&amp;rsquo;：模型隐式绑定了训练车的动力学特性，换车即翻车。它用轻量物理编码器编码轴距、质量、驱动方式等物理属性，通过交叉注意力注入冻结的场景编码器，在不损失视觉泛化能力的前提下实现跨车型适应。在 58 种车型上的零样本迁移表现大幅领先 naive transfer 和 URMA 等基线。</description>
    </item>
    <item>
      <title>论文精读｜Teaching VLA Models What to See and Where to Look：DriveTeach-VLA 的视觉教学三段式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/driveteach-vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/driveteach-vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveTeach-VLA 指出驾驶 VLA 的瓶颈不在语言推理而在视觉空间 grounding，核心问题不是&amp;rsquo;想不清&amp;rsquo;而是&amp;rsquo;看不对&amp;rsquo;。它提出三段式视觉教学管线——DVD 蒸馏教模型&amp;rsquo;看什么&amp;rsquo;、2D 轨迹引导提示教&amp;rsquo;往哪看&amp;rsquo;、TGP-guided GRPO 教&amp;rsquo;怎么动&amp;rsquo;——层层递进注入驾驶感知先验。在 Qwen2.5-VL 上刷新 NAVSIM 与 nuScenes 双榜单 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜具身智能：形态、动作、感知与学习的协同——全面综述</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/embodied-intelligence-synergy-2025/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/embodied-intelligence-synergy-2025/</guid>
      <description>本文从形态、动作、感知与学习四个维度的协同关系出发，系统综述了具身智能的研究进展，强调智能是大脑、身体与环境紧密耦合的产物，并提出了统一的具身智能框架。</description>
    </item>
    <item>
      <title>论文精读｜From Foundation to Application: Improving VLA Models in Practice（LingBot-VLA 2.0）</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-06403/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-06403/</guid>
      <description>蚂蚁 LingBot-VLA 2.0 在数据、动作空间、预测建模三个维度同时补课：6 万小时多本体预训练数据覆盖 9 种构型，全身自由度动作空间支持头部/腰部/底盘/灵巧手协同控制，双查询蒸馏赋予模型向前看的预测能力。Token 级稀疏 MoE 动作专家有效解耦多本体异构动力学。在 GM-100 双臂基准与长程移动操作上全面领先 π0.5。</description>
    </item>
    <item>
      <title>论文精读｜iPad: Iterative Proposal-centric End-to-End Autonomous Driving</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/ipad-end-to-end-autonomous-driving/</link>
      <pubDate>Wed, 29 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/ipad-end-to-end-autonomous-driving/</guid>
      <description>iPad提出了一种以轨迹提案为中心的端到端自动驾驶框架，通过ProFormer迭代式精炼稀疏BEV提案，替代了传统的密集BEV网格范式，在NAVSIM和Bench2Drive上达到SOTA且计算效率提高10倍以上。</description>
    </item>
    <item>
      <title>论文精读｜虚实对齐：具身智能的全面综述——从仿真到真实的迁移</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/cyber-physical-alignment-2024/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/cyber-physical-alignment-2024/</guid>
      <description>本文从虚实对齐的视角全面综述具身智能，系统分析了具身感知、具身交互、具身智能体和仿真到真实迁移四大研究方向，深入探讨了多模态大模型在虚拟和现实具身智能体中的应用。</description>
    </item>
    <item>
      <title>论文精读｜DrivoR: Driving on Registers — 基于寄存器token的高效端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivor-driving-on-registers/</link>
      <pubDate>Wed, 29 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivor-driving-on-registers/</guid>
      <description>DrivoR提出了一种极简的纯Transformer端到端自动驾驶架构，利用ViT寄存器token将多相机视觉特征压缩为紧凑场景表示，仅需~40M参数即可在NAVSIM和HUGSIM上达到SOTA。</description>
    </item>
    <item>
      <title>论文精读｜ABot-M0.5：统一的移动操作世界动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-00678/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-00678/</guid>
      <description>ABot-M0.5 用&amp;rsquo;三层对齐&amp;rsquo;策略重新设计了移动操作的世界动作模型：潜在动作模块在帧级粒度捕捉视觉状态转移，解决时间粒度粗糙导致的精细接触丢失。双层 Mixture-of-Transformers 解耦导航与操作的动作空间，dream-forcing 训练策略打通训练与推理的分布鸿沟。在长程任务和精细控制上同时达到 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜ExploreVLA：密集世界建模与探索驱动的端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02714/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02714/</guid>
      <description>VLA 模型通过行为克隆学习驾驶策略，但受限于模仿学习无法探索专家分布之外的高质量策略。ExploreVLA 提出统一的理解-生成框架：用未来 RGB + 深度图生成作为密集世界建模目标，再利用世界模型的图像预测不确定性作为内在探索奖励，通过安全门控的 GRPO 优化策略。在 NAVSIM 上达到 93.7 PDMS 和 88.8 EPDMS。</description>
    </item>
    <item>
      <title>论文精读｜Agent-driven Long-tail Simulation for Autonomous Driving：用 LLM 代理驱动自动驾驶长尾仿真</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-04331/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-04331/</guid>
      <description>本文用指令跟随 LLM 代理接管仿真器中所有交通参与者，抛弃了日志回放和规则代理的传统仿真范式。LLM 通过结构化动作接口控制每辆车的目标速度、车道与让行行为，配合 Flow-Matching 轨迹生成器实现高保真物理执行。配套的 SemanticPlan 长尾语义闭环基准暴露出 SOTA 规划器在意图性交互场景中仍频繁翻车的短板。</description>
    </item>
    <item>
      <title>论文精读｜K-Risk：知识增强的高风险驾驶场景数据集</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-07103/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-07103/</guid>
      <description>K-Risk 整合欧美中三大洲 20 个轨迹数据集，用 DRF 驱动风险筛选流水线统一抽取高风险事件。它通过 LLM 为每个事件生成三元组标注（结构化描述+异常行为通知+经闭环仿真器验证的因果风险分析），首次将高风险事件标签、语义标注和可验证决策信号三合一打包。产出 31,398 个高风险事件和 1,036 个极端近碰撞子集，为风险感知自动驾驶提供标准化评测基础。</description>
    </item>
    <item>
      <title>论文精读｜Vesta：统一的具身推理通用模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-20905/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-20905/</guid>
      <description>NVIDIA 的 Vesta 用单一 Qwen3-VL-8B 基础模型统一定位、空间推理、导航和长程规划四大具身智能能力，取代了传统的拼装专家路线。它通过统一的条件语言生成范式和简洁的多模态记忆挽具，让自注意力在历史帧与当前观察间建立长程依赖。平均超越各类别最优专家 20% 以上，真机任务成功率提升超 35%。</description>
    </item>
    <item>
      <title>论文精读｜LingBot-VLA：务实的 VLA 基础模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2601-18692/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2601-18692/</guid>
      <description>LingBot-VLA 以&amp;rsquo;务实&amp;rsquo;为核心设计哲学，用 9 种双臂构型、约 2 万小时真机数据训出一个跨平台 VLA 基础模型。它通过跨构型预训练学出与具体硬件解耦的动作策略，辅以开源高效代码库（8 卡 261 样本/秒）和 GM-100 基准。在 4 个平台 100 类任务上展现强泛化能力，将 VLA 从论文模型推向产线工具。</description>
    </item>
    <item>
      <title>CoWorld-VLA精读：多专家世界模型中的自动驾驶推理</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/coworld-vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/coworld-vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>CoWorld-VLA 在 VLM 隐空间中构建多专家 Latent CoT 推理框架，解决了文本 CoT 丢失空间信息而隐空间缺乏可条件化信号的根本矛盾。它通过语义交互、几何结构、动态演化与轨迹意图四种专家 Token，将互补的世界知识编码为显式可用的规划条件。在 NAVSIM v1 上达到 89.8 PDMS，证明了结构化隐式推理的有效性。</description>
    </item>
    <item>
      <title>RT-2精读：VLA奠基之作——将网络知识迁移到机器人控制</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-2%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-2%E7%B2%BE%E8%AF%BB/</guid>
      <description>RT-2 由 Google DeepMind 提出，首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型，让网络知识迁移到具身控制，使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力，是 VLA 范式的奠基之作。</description>
    </item>
    <item>
      <title>VLA-World精读：统一预测想象与反思推理的视觉-语言-行动世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-09059/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-09059/</guid>
      <description>VLA-World 通过将 VLA 的推理能力与世界模型的预测想象统一在单一框架中，实现了预测-生成-反思-规划的完整闭环。它利用动作驱动的可行轨迹引导下一帧图像生成，再对自生成的未来帧进行推理以修正轨迹，在 nuScenes 的规划和生成基准上均达到 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜nuTruck：面向分布式电驱重卡的自动驾驶规划闭环基准</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-13704/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-13704/</guid>
      <description>nuTruck 是首个面向分布式电驱重卡（DET）的规划训练与闭环评测基准，填补了学习型规划器在重卡领域被忽视的安全空白。它构建三轴六轮高保真非线性动力学模型并引入侧翻风险指标 LTR 与 NRS，证明了乘用车时代的&amp;rsquo;无碰撞即安全&amp;rsquo;假设在重卡上完全失效。核心发现：规划层必须考虑动力学安全，下游控制器无法兜底。</description>
    </item>
    <item>
      <title>论文精读｜VADv2：概率规划——把驾驶决策从&#34;猜唯一答案&#34;变成&#34;算概率分布&#34;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-0959/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-0959/</guid>
      <description>VADv2 把驾驶规划从&amp;rsquo;猜唯一答案&amp;rsquo;的确定性回归改造成&amp;rsquo;算所有动作的概率分布再采样&amp;rsquo;的概率规划范式。它用规划词表离散化连续动作空间、用概率场函数建模场景与动作的关联，天然处理多模态非凸解空间。在 CARLA Town05 将 Drive Score 从 76.1 拉到 85.1，且无需任何规则后处理，被 ICLR 2026 接收。</description>
    </item>
    <item>
      <title>论文精读｜WCog-VLA：双层级世界认知，让自动驾驶从被动反应走向主动博弈</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-08375/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-08375/</guid>
      <description>WCog-VLA 是首个桥接语义层世界预测与生成层世界演化的 VLA 框架，将 VLA 从被动反应推向主动博弈。语义层用 agent token+Game-CoT（Stackelberg 博弈思维链）做世界预测与意图推理，生成层用对齐解耦扩散 Transformer 合成多智能体联合轨迹。在 NAVSIM 刷新 PDMS 92.9 的 SOTA，证明双层级世界认知是 VLA 进阶的关键方向。</description>
    </item>
    <item>
      <title>论文精读｜DriveTransformer：统一Transformer——告别BEV，拥抱稀疏Token并行交互</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-drivetransformer/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-drivetransformer/</guid>
      <description>DriveTransformer 彻底抛弃了 BEV 表示——不再构建稠密 BEV 特征，而是让任务 query 直接与原始传感器特征交互。三种注意力（Sensor Cross-Attention、Task Self-Attention、Temporal Cross-Attention）构成统一框架，支持单阶段端到端训练。在 Bench2Drive 闭环评测中以 63.46 Driving Score 大幅超越 UniAD（45.81）和 VAD（42.35），且在鲁棒性上碾压 BEV 方案。获 ICLR 2025 接收。</description>
    </item>
    <item>
      <title>论文精读｜TransFuser：用 Transformer 做传感器融合——让相机和激光雷达&#34;商量着开车&#34;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-transfuser/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-transfuser/</guid>
      <description>TransFuser 在 CARLA 上首次验证了 Transformer 做多模态传感器融合的可行性——用自注意力让图像和 LiDAR 特征在多个分辨率上密集交互，取代简单的几何融合。在 CARLA Leaderboard 和 Longest6 基准上以显著优势领先此前所有方法，将碰撞率降低 48%。</description>
    </item>
    <item>
      <title>论文精读｜Diffusion Policy：扩散模型做机器人动作生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-policy%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-policy%E7%B2%BE%E8%AF%BB/</guid>
      <description>Diffusion Policy 将机器人动作生成重新定义为条件去噪过程，让策略网络从噪声中逐步雕刻出动作序列。它天然支持多模态动作分布与高维动作空间，解决了传统行为克隆的 mode averaging 和复合误差问题。经 CNN 和 Transformer 双架构验证，成为后续 π0、Qwen-VLA 等 VLA 模型动作头设计的奠基之作。</description>
    </item>
    <item>
      <title>论文精读｜World4Drive：用意图感知的物理隐世界模型，摆脱感知标注做端到端规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2507-00603/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2507-00603/</guid>
      <description>World4Drive 是首个将多模态驾驶意图与物理隐世界模型结合的端到端框架，无需 3D 框/高精地图等昂贵感知标注。它借 Grounded-SAM 的语义先验和 Metric3D 的深度先验构建&amp;rsquo;懂物理&amp;rsquo;的隐空间，让模型在多种驾驶意图下想象未来、用世界模型打分选最优轨迹。L2 误差降 18.1%、碰撞率降 46.7%、收敛快 3.75 倍，被 ICCV 2025 收录。</description>
    </item>
    <item>
      <title>论文精读｜PARA-Drive：完全并行的端到端架构，把感知预测规划&#34;同时跑&#34;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-para-drive/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-para-drive/</guid>
      <description>PARA-Drive 系统性地探索了端到端模块化自动驾驶的设计空间，提出完全并行的架构——感知、预测、规划模块同时训练、同时推理，互不依赖。在 nuScenes 上 L2 误差降低 28.8%、碰撞率降低 43.3%，推理速度提升近 3 倍，被 CVPR 2024 接收。</description>
    </item>
    <item>
      <title>论文精读｜VLA for Autonomous Driving：自动驾驶视觉-语言-动作模型的过去、现在与未来</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2512-16760/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2512-16760/</guid>
      <description>这份 47 页的综述首次为自动驾驶 VLA 建立了系统形式化与分类法，从 VA（视觉-动作）到 VLA（视觉-语言-动作）理清演进线。它提出端到端 VLA 与双系统 VLA 两大范式分类，并统一梳理了动作空间四分法、数据集基准与评测协议。是当前自动驾驶 VLA 领域最权威的架构脉络地图和未来挑战指南。</description>
    </item>
    <item>
      <title>论文精读｜TruckV2X：首个以重卡为中心的 V2X 车路协同感知数据集，专治盲区与挂车遮挡</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-truckv2x/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-truckv2x/</guid>
      <description>TruckV2X (IEEE RA-L 2025) 是首个以半挂重卡为中心的 V2X 多模态多智能体协同感知数据集，用 CARLA 仿真构建 64 个场景、88,396 帧点云、百万图像、118 万 3D 框，覆盖牵引车-挂车-CAV-RSU 四类智能体，系统性揭示重卡因车身长、挂车摆动、转弯内侧盲区而对车路协同的刚需。</description>
    </item>
    <item>
      <title>论文精读：DiffusionDriveV2 — RL-Constrained Truncated Diffusion</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2512-07745/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2512-07745/</guid>
      <description>DiffusionDriveV2 将强化学习引入截断扩散模型，提出 Intra-Anchor GRPO 和 Inter-Anchor Truncated GRPO，解决了 DiffusionDrive 中多样性与一致高质量之间的根本矛盾。在 NAVSIM v1 上达到 91.2 PDMS，v2 上达到 85.5 EPDMS，均创下新纪录。</description>
    </item>
    <item>
      <title>论文精读｜ACT &#43; ALOHA：低成本双臂遥操作与动作分块策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/act-aloha%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/act-aloha%E7%B2%BE%E8%AF%BB/</guid>
      <description>ACT+ALOHA 用不到 2 万美元的开源双臂遥操作平台解决了精细双臂操控的数据获取难题。ACT 采用动作分块（Action Chunking）+CVAE Transformer 的抗复合误差策略，将模仿学习精度推至新高度。ALOHA 的低成本同构主从机械臂设计为具身智能数据采集建立了新范式。</description>
    </item>
    <item>
      <title>论文精读：Longitudinal Safety Distance Control Considering Cargo Load（ICVES 2025）——RSS 安全距离模型为什么漏算了满载重卡的刹车</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-cargoload-rss/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-cargoload-rss/</guid>
      <description>ICVES 2025 论文 Longitudinal Safety Distance Control Considering Cargo Load for Autonomous Heavy-Duty Vehicles 指出经典 RSS 安全距离模型假设车辆质量恒定，忽略了货物载荷，导致满载重卡制动距离更长、RSS 给出的安全距离不足而撞车。本文从 RSS 公式出发，讲清质量/载荷如何修正制动距离，并呼应博客 nuTruck 一文：现有 benchmark 不把质量/动力学安全作为指标。</description>
    </item>
    <item>
      <title>RiskWorld 论文精读：以目标为中心的潜在世界模型，用于自动驾驶风险识别</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/riskworld%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/riskworld%E7%B2%BE%E8%AF%BB/</guid>
      <description>北航 × 中关村实验室 RiskWorld 精读：不用「全局想象未来帧」，而是为每个周围目标单独跑一遍「如果它继续运动会怎样」的 RSSM 潜在动力学推演，从中解码出目标级风险评分。RiskBench 上 F1=63.0%、误报率仅 2.1%，在「谁是风险源」这个精准定位问题上超过了所有基线。</description>
    </item>
    <item>
      <title>SimWAM 代码完整解读：从 Video DiT 到 Action DiT，从 SFT 到 FlowGRPO 的逐行拆解</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/simwam%E4%BB%A3%E7%A0%81%E5%AE%8C%E6%95%B4%E8%A7%A3%E8%AF%BB/</link>
      <pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/simwam%E4%BB%A3%E7%A0%81%E5%AE%8C%E6%95%B4%E8%A7%A3%E8%AF%BB/</guid>
      <description>从 configs/model/simwam_navsim.yaml 第 1 行开始，逐层追踪 SimWAM 的完整逻辑链：两个专家怎么协作？Isolated Attention Mask 怎么实现训练时借力、推理时独立？联合 Flow Matching 训练的损失怎么算？FlowGRPO 的 SDE 采样、PDM 奖励、LoRA 微调怎么串起来？每段代码都标注了源文件路径。</description>
    </item>
    <item>
      <title>Flow-GRPO 完全讲解：训练/推理/梯度流/Loss 设计的逐行拆解</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/flow-grpo-complete-guide/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/flow-grpo-complete-guide/</guid>
      <description>从 train_flux_fast.py 第 1 行开始，逐层追踪 Flow-GRPO 的完整逻辑链：采样阶段做了什么？reward 怎么变成 advantage？训练阶段的计算图是怎么构造的？loss 为什么那样设计？梯度如何从最后一个 log_prob 传到 LoRA 参数？每段代码都标注了源文件行号。</description>
    </item>
    <item>
      <title>端到端自动驾驶模型架构全解：从感知到规划的六大范式与 80&#43; 模型逐篇拆解</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-model-architecture-synthesis/</link>
      <pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-model-architecture-synthesis/</guid>
      <description>把博客全部自动驾驶模型精读收进同一坐标系：显式端到端 / Scoring / 扩散与Flow / VLA / 世界模型 / 数据评测基建六大范式，80&#43; 模型逐篇给出感知表征、架构组成、训练方式与 PDMS/EPDMS 分数，最后给出我对端到端演进方向的个人思考。</description>
    </item>
    <item>
      <title>纯视觉端到端模型在 Cosmos 风格迁移加持下的 NAVSIM 大规模评测：11 个开源模型全景</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/e2e-navsim-models-cosmos-style/</link>
      <pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/e2e-navsim-models-cosmos-style/</guid>
      <description>课题组新 benchmark：用 Cosmos 做雨/雪/晴风格迁移构建 NAVSIM 视觉压力测试，批量评测 11 个纯视觉（camera-only）端到端规划模型。本文系统梳理 SparseDriveV2、iPad、DrivoR、ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0、Drive-JEPA、DriveSuprim、DriveLaW、LTF 的论文架构（附 arXiv 原文架构图）、开源资源、评测配置与 NAVSIM PDMS/EPDMS 成绩。</description>
    </item>
    <item>
      <title>Cosmos 3 代码讲解：Mixture-of-Transformers 双塔统一五模态世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/cosmos3%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Wed, 29 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/cosmos3%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>拆解 NVIDIA/cosmos-framework：MoT 双塔架构让 Reasoner（自回归语义理解）和 Generator（扩散生成）共享每一层 Transformer 权重但各有独立投影；DCAE 对视频做 4×32×32 极致压缩；Rectified Flow 做生成训练；序列打包（sequence packing）把 und/gen token 拼成一条序列走一次前向</description>
    </item>
    <item>
      <title>Cosmos-3 &#43; MoE &#43; Flow-GRPO 架构概览</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/cosmos3-moe-flowgrpo-arch/</link>
      <pubDate>Thu, 23 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/cosmos3-moe-flowgrpo-arch/</guid>
      <description>本文提出一种将 Cosmos-3 双塔 MoT、DeepSeek-style Sparse MoE、Flow Matching 与 Flow-GRPO 结合的架构设计方案，系统描述各模块的角色、接口与训练推理流程。</description>
    </item>
    <item>
      <title>思考｜重卡 VLA 是一个巨大的研究空白——兼论 Truck-VLA 架构设计</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/%E9%87%8D%E5%8D%A1vla%E7%A0%94%E7%A9%B6%E7%A9%BA%E7%99%BD%E4%B8%8E%E5%89%8D%E7%9E%BB/</link>
      <pubDate>Thu, 23 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/%E9%87%8D%E5%8D%A1vla%E7%A0%94%E7%A9%B6%E7%A9%BA%E7%99%BD%E4%B8%8E%E5%89%8D%E7%9E%BB/</guid>
      <description>2024-2026 年自动驾驶 VLA 论文爆发（100&#43; 篇），但全部聚焦乘用车。重卡场景的 VLA 模型——能理解语言指令、感知场景、输出安全轨迹的端到端系统——迄今零论文。本文系统分析了这个空白的成因，并提出了完整的 Truck-VLA 架构设计方案。</description>
    </item>
    <item>
      <title>AlpaMayo-R1 代码讲解：VLM 说推理链、Expert 雕轨迹、一个模型两套头</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/alpamayo-r1%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/alpamayo-r1%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>零基础逐文件拆解 NVIDIA AlpaMayo-R1 推理源码：从 VLM/Expert/Diffusion 三组件架构到单轮动力学动作空间，从 Flow Matching 去噪到 Fourier 特征编码，用伪代码 + 大白话讲清这个 10B 参数的 VLA 模型是怎么从传感器数据一路「推理」到轨迹输出的。</description>
    </item>
    <item>
      <title>论文精读｜TransDiffuser：去相关多模态表示驱动的扩散式轨迹生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2505-09315-transdiffuser/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2505-09315-transdiffuser/</guid>
      <description>LiAuto 提出 TransDiffuser，用多模态表示去相关（Decorrelation）解决扩散轨迹生成中的模式坍缩问题。核心思路是强制多模态条件特征的维度去相关，让条件信号更丰富地覆盖潜空间，从而无需任何锚点轨迹或场景先验即可生成多样化轨迹。ResNet-34 + LiDAR 配置在 NAVSIM 上达到 PDMS 94.85。本文将用一张图一张图对应讲解的方式，把这篇论文的动机、架构、核心创新全部讲清楚。</description>
    </item>
    <item>
      <title>如何在NAVSIM刷到PDMS 90分以上</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/navsim-pdms-90/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/navsim-pdms-90/</guid>
      <description>深入分析了NAVSIM排行榜上所有高分方法的共同策略、技术路线和实战技巧，从PDMS公式拆解到CLOVER闭式蒸馏，一步步教你如何提升PDMS分数。</description>
    </item>
    <item>
      <title>AutoVLA 代码讲解：把「开车」变成「说动作 token」并用 GRPO 微调</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/autovla%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/autovla%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>拆解 ucla-mobility/AutoVLA：动作 codebook 离散化、快慢思考两阶段训练、SFT &#43; GRPO 拒绝采样微调，看 VLA 如何端到端输出可执行驾驶动作</description>
    </item>
    <item>
      <title>Diffusion Planner 代码讲解：轨迹级扩散 &#43; 免训练能量引导</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/diffusionplanner%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/diffusionplanner%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>拆解 ZhengYinan-AIR/Diffusion-Planner：DiT &#43; MLP-Mixer 去噪轨迹、DDPM 训练、classifier guidance 做碰撞/可达性无训练约束，看轨迹扩散规划如何做到 SOTA 且即插即用</description>
    </item>
    <item>
      <title>Diffusion Policy 代码讲解：用 DDPM 给机器人「生成」一连串动作</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/diffusionpolicy%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/diffusionpolicy%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>拆解 real-stanford/diffusion_policy：ConditionalUnet1D 去噪网络、观察/动作视野、LinearNormalizer 归一化、Workspace/Dataset/Policy 解耦，看通用扩散动作策略如何落地</description>
    </item>
    <item>
      <title>pi0 代码讲解：通用 VLA 的「VLM 主干 &#43; Flow Matching 动作专家」</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/pi0%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/pi0%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>拆解 Physical-Intelligence/openpi：PaliGemma VLM 当通用感知-语义主干，独立的 Flow Matching action expert 在 10 步 ODE 内生成连续动作，看通用机器人 VLA 如何端到端输出动作</description>
    </item>
    <item>
      <title>UniAD 代码讲解：端到端自动驾驶的「全栈 Transformer」是怎么拼起来的</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/uniad%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/uniad%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>拆解 OpenDriveLab/UniAD：从 BEV 特征、TrackFormer、MapFormer、MotionFormer 到 Planner 的查询式流水线，以及两阶段训练与 nuScenes 推理</description>
    </item>
    <item>
      <title>VAD 代码讲解：把场景「矢量化」后，端到端能有多轻</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/vad%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/vad%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>拆解 hustvl/VAD：用向量化 agent/地图/运动表示替代稠密占用与分割，看 VAD/ VADv2 如何用更少 head 做端到端规划</description>
    </item>
    <item>
      <title>代码讲解：DiffusionDrive 从架构到训练推理的完整闭环</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/diffusiondrive%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/diffusiondrive%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>逐行拆解 hustvl/DiffusionDrive 的真实源码，面向零基础读者：从架构图与全局数据流出发，用大白话讲清什么是 anchor、什么是去噪、什么是 cross-attention、什么是 BEV、什么是截断扩散，再逐文件讲清它如何作为 navsim 的 Agent 插件挂载，最后把一次前向传播拆成 7 到 8 步、把训练和推理的差异讲透。一篇把项目挂载方式→数据流→前向传播→训练梯度→推理选轨迹→个人思考全部讲明白的极详细工程向代码讲解。</description>
    </item>
    <item>
      <title>代码讲解：DiffusionDriveV2 — 用 GRPO 强化学习给截断扩散的多样轨迹「上安全锁」</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/diffusiondrivev2%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/diffusiondrivev2%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>「DiffusionDriveV2 在 DiffusionDrive 的 anchor 截断扩散之上，补了一套 GRPO 强化学习微调：用 scale-adaptive 乘性噪声做探索、Intra-Anchor GRPO 保住多模态不坍缩、Inter-Anchor Truncated GRPO 用碰撞惩罚把低质量轨迹压下去，最后加两级 Mode Selector 精排，在 NAVSIM v1 上冲到 91.2 PDMS。本文基于论文 Algorithm 还原成逐文件逐函数伪代码，从 cold start 权重加载写到 rollout → advantage → loss 的完整 RL 训练循环。」</description>
    </item>
    <item>
      <title>代码讲解：DriveVLA-W0 世界模型如何给 VLA 大模型补上稠密监督</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/drivevla-w0%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/drivevla-w0%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>逐行拆解 BraveGroup/DriveVLA-W0 的已开源代码，面向零基础读者：先讲清 VLA、世界模型、MoE、Flow Matching、FAST tokenizer 等黑话，再厘清仓库边界（只开源了 policy_head 与 tokenizer，VLM 主干在外部库），然后逐文件拆解 MoE 动作专家、Flow Matching 解码器、扩散策略头、动作 tokenizer 与世界模型 VQ 编码器，最后把一次前向从图像到轨迹串成 7 步、讲透两阶段训练与推理旁路世界模型的设计。一篇把代码边界到数据流到关键模块到训练梯度到推理选轨迹到个人思考全部讲明白的极详细工程向代码讲解。</description>
    </item>
    <item>
      <title>代码讲解：SparseDriveV2 因子化轨迹词汇表与两级评分的完整闭环</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/sparsedrivev2%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/sparsedrivev2%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>逐行拆解 swc-17/SparseDriveV2 的真实源码：从架构图与全局数据流出发，用最通俗的大白话讲清几何路径乘以速度剖面如何因子化组合成 26 万条轨迹词汇表、两级评分怎么把候选从 26 万粗筛到 200 条再精排、PDM score 蒸馏损失如何用排行榜判分器当老师。一篇把项目挂载方式、数据流、前向传播、训练梯度、推理选轨迹、个人思考全部讲透、面向零基础读者的工程向代码讲解。</description>
    </item>
    <item>
      <title>论文精读：Drive-JEPA — Video JEPA 预训练 &#43; 多模态轨迹蒸馏的端到端驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2601-22032/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2601-22032/</guid>
      <description>Drive-JEPA（2026）指出端到端驾驶的两个瓶颈：(1) 视频世界模型预训练收益有限；(2) 每场景只有一条人类轨迹，多模态监督稀缺。它用 V-JEPA（而非生成式世界模型）在 208 小时驾驶视频上自监督预训练 ViT 编码器，得到规划对齐的表征；再用基于仿真器的「多模态轨迹蒸馏」把多样伪教师轨迹蒸馏进 proposal-centric 规划器，并以动量感知选择抑制帧间抖动。NAVISIM v1 达 93.3 PDMS、v2 达 87.8 EPDMS 双榜 SOTA，仅前视相机+轻量 transformer 即在无感知设定下超此前 SOTA 3 PDMS。</description>
    </item>
    <item>
      <title>论文精读：GTRS — 通用轨迹评分（CVPR25 自动驾驶挑战赛冠军）</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-06664/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-06664/</guid>
      <description>GTRS（NVIDIA, CVPR 2025 自动驾驶挑战赛 E2E 赛道冠军）指出：现有轨迹评分器要么打「静态大词表」要么打「动态小候选」，两者都泛化差。GTRS 用三根支柱统一二者：(1) 扩散策略生成细粒度动态候选；(2) 在 16384 的超密集词表上训练评分器 + 词表 dropout，使推理时能在更小子集上强泛化；(3) 传感器旋转增强 + top-k 细化自蒸馏，提升域外鲁棒性。Navhard 榜 EPDMS 最高 49.4，逼近依赖真值感知的 PDM-Closed。</description>
    </item>
    <item>
      <title>论文精读：WoTE — 用 BEV 世界模型做在线轨迹评估的端到端驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2504-01941/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2504-01941/</guid>
      <description>WoTE（ICCV 2025, CASIA）指出：端到端规划器只生成轨迹却「盲目」选轨迹，缺少对未来后果的预判。它用一个 BEV 空间世界模型，给每条候选轨迹 rollout 出未来 BEV 状态，再由奖励模型打分挑最高奖励者。BEV 空间比图像级世界模型省算力，且能直接用 nuPlan 等 BEV 仿真器提供监督。NAVISIM 达 88.3 PDMS，Bench2Drive 闭环 Driving Score 61.71 创 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜Anti-rollover APF — 用五自由度动力学 &#43; 侧翻排斥势场，让重卡规划阶段就避开翻车</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-antirollover-apf/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-antirollover-apf/</guid>
      <description>本文精读 Jin 与 He 在 2024 年 Chinese Journal of Mechanical Engineering 发表的 Anti-rollover Artificial Potential Field Motion Planning Method of an Autonomous Heavy Truck Optimised by Game Theory。论文用 5-DOF 重卡动力学模型推导侧翻指标，提出把侧翻排斥势场（anti-rollover APF）融入 MPC 运动规划，并用博弈论优化势场权重，让重卡在规划阶段就同时兼顾避障与防侧翻。面向刚入行的 VLA 工程师，用大白话讲清侧翻机理、LTR 判据、五自由度模型与势场规划框架，并呼应博客 nuTruck 文章。</description>
    </item>
    <item>
      <title>论文精读｜TruckDrive — 面向重卡的长距离高速公路感知数据集，把感知边界推到 1000 米</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-truckdrive/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-truckdrive/</guid>
      <description>TruckDrive 是 Torc Robotics 与普林斯顿大学在 CVPR 2026 提出的面向半挂重卡的高速公路长距离多模态感知数据集，含 47.5 万同步样本、16.5 万密集标注帧，2D 标注延伸到 1000 米、3D 标注延伸到 400 米，配备了 7 台长距 FMCW 激光雷达、10 台 4D 雷达与 11-15 路多焦距相机。本文用大白话拆解其传感器架构（含完整的传感器位置坐标表）、标注流水线、与 nuScenes/ONCE 等数据集的定量对比，并深入分析重卡制动距离公式、高速场景对感知的独特要求（300-500 米安全感知窗口），以及当前 VLA 模型在 150 米处系统性失效的原因。文章还包含感知距离需求对比图、TruckDrive 车辆传感器部署实拍、以及范围分布图等多个可视化素材。</description>
    </item>
    <item>
      <title>NAVSIM 排行榜深度分析：谁在统治端到端规划？架构、创新与分数全解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/navsim%E6%8E%92%E8%A1%8C%E6%A6%9C%E6%B7%B1%E5%BA%A6%E5%88%86%E6%9E%90/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/navsim%E6%8E%92%E8%A1%8C%E6%A6%9C%E6%B7%B1%E5%BA%A6%E5%88%86%E6%9E%90/</guid>
      <description>NAVSIM 已成为端到端规划的事实标准benchmark，PDMS/EPDMS排行榜上群雄逐鹿。本文系统梳理navtest/navhard双榜Top方法，从Scoring-based、Diffusion-based、VLA、World Model 四大技术路线解构各家架构设计与核心创新，严格区分官方排行榜已录结果与arXiv宣称结果，并深入拆解 PDMS 每个子指标（NC/DAC/TTC/EP/C）的内部计算方式与撞车实例。数据截至2026年7月。</description>
    </item>
    <item>
      <title>nuPlan数据集详解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/nuplan%E6%95%B0%E6%8D%AE%E9%9B%86%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/nuplan%E6%95%B0%E6%8D%AE%E9%9B%86%E8%AF%A6%E8%A7%A3/</guid>
      <description>&lt;h2 id=&#34;一概述&#34;&gt;一、概述&lt;/h2&gt;
&lt;p&gt;nuPlan 是由 Motional（原 nuTonomy 团队）于 2023 年发布的大规模自动驾驶规划数据集与闭环仿真评测框架。与 nuScenes 主要聚焦感知任务不同，nuPlan 的设计初衷是填补规划领域三个核心空白：缺乏大规模人类驾驶规划数据、缺乏标准化闭环评测指标、以及缺乏可复现的仿真评估协议。&lt;/p&gt;
&lt;p&gt;nuPlan 的核心规模数据：&lt;strong&gt;1500 小时&lt;/strong&gt;的人类驾驶数据，覆盖全球四个城市——波士顿（Boston）、匹兹堡（Pittsburgh）、拉斯维加斯（Las Vegas）和新加坡（Singapore）。这些城市的驾驶环境具有显著差异：波士顿的老城区窄路与不规则交叉口、匹兹堡的丘陵道路与桥梁、拉斯维加斯的宽阔多车道网格化道路、新加坡的右舵驾驶与密集高架路网。&lt;/p&gt;
&lt;p&gt;nuPlan 最革命性的贡献在于：它不仅是一个数据集，更是一个&lt;strong&gt;完整的闭环仿真平台&lt;/strong&gt;。研究者可以在 nuPlan 仿真环境中部署自己的规划模型，与不同类型的交通参与者（log-replay 或 reactive agent）交互，并从安全性、合规性和通行效率等多个维度自动评估模型表现。这种&amp;quot;数据+仿真+评估&amp;quot;三位一体的设计，使 nuPlan 成为目前自动驾驶规划领域最全面的基准平台。&lt;/p&gt;
&lt;h2 id=&#34;二数据采集与统计&#34;&gt;二、数据采集与统计&lt;/h2&gt;
&lt;h3 id=&#34;21-数据规模对比&#34;&gt;2.1 数据规模对比&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th&gt;nuScenes&lt;/th&gt;
          &lt;th&gt;nuPlan&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;总驾驶时长&lt;/td&gt;
          &lt;td&gt;约 5.5 小时&lt;/td&gt;
          &lt;td&gt;约 1500 小时&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;场景/Log 数&lt;/td&gt;
          &lt;td&gt;1000 个 scene&lt;/td&gt;
          &lt;td&gt;约 1282 个 log&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;标注关键帧&lt;/td&gt;
          &lt;td&gt;约 40,000&lt;/td&gt;
          &lt;td&gt;约 150 万&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;标注 3D 框总数&lt;/td&gt;
          &lt;td&gt;约 140 万&lt;/td&gt;
          &lt;td&gt;约 5900 万&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;覆盖城市&lt;/td&gt;
          &lt;td&gt;2（波士顿、新加坡）&lt;/td&gt;
          &lt;td&gt;4（波士顿、匹兹堡、拉斯维加斯、新加坡）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;传感器配置&lt;/td&gt;
          &lt;td&gt;6 Cam + 5 Radar + 1 LiDAR&lt;/td&gt;
          &lt;td&gt;同 nuScenes（部分 Log 不同）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;高精度地图&lt;/td&gt;
          &lt;td&gt;无&lt;/td&gt;
          &lt;td&gt;完整 HD Map（车道拓扑、交通标志）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;仿真环境&lt;/td&gt;
          &lt;td&gt;无&lt;/td&gt;
          &lt;td&gt;内置闭环仿真器&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id=&#34;22-四城市特点&#34;&gt;2.2 四城市特点&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;波士顿&lt;/strong&gt;：美国东北部老城，街道较窄且不规则，存在大量无保护左转、两阶段左转和环形交叉口。历史街区的道路拓扑复杂，行人活动频繁。冬季还可能遇到积雪和湿滑路面。波士顿的数据量约占全部数据的 30%。&lt;/p&gt;</description>
    </item>
    <item>
      <title>nuScenes数据集详解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/nuscenes%E6%95%B0%E6%8D%AE%E9%9B%86%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/nuscenes%E6%95%B0%E6%8D%AE%E9%9B%86%E8%AF%A6%E8%A7%A3/</guid>
      <description>&lt;h2 id=&#34;一概述&#34;&gt;一、概述&lt;/h2&gt;
&lt;p&gt;nuScenes 是由 Aptiv（现 Motional）与 nuTonomy 团队于 2019 年发布的大规模自动驾驶多模态数据集，也是最早提供完整传感器套件标注的全场景数据集之一。它的发布标志着自动驾驶感知研究从单一传感器（仅 LiDAR 或仅 Camera）向多传感器融合的重要转折，极大地推动了 3D 检测、跟踪、预测和规划等多个方向的发展。&lt;/p&gt;
&lt;p&gt;nuScenes 包含 1000 个驾驶场景（scene），每个场景时长约 20 秒，步长 20Hz 录制，关键帧以 2Hz 采样标注。数据采集覆盖波士顿和新加坡两个城市——包括城市主干道、居民区、十字路口、环形交叉口、隧道和高速公路等多种路况，以及白天、夜晚、黄昏、雨天等不同光照和天气条件。这种多样性使得基于 nuScenes 训练的模型对光照和天气变化具有更好的鲁棒性。&lt;/p&gt;
&lt;p&gt;该数据集的核心价值在于其多模态特性：每辆数据采集车在同一时间戳下同时提供 6 个环视摄像头图像（覆盖 360° 视野）、5 个毫米波雷达点云和 1 个 32 线 Velodyne 激光雷达点云。研究者可以基于这些数据开发真正利用多模态传感器融合的感知算法，也可以分别验证不同传感器配置下算法的性能上限。&lt;/p&gt;
&lt;h2 id=&#34;二传感器配置&#34;&gt;二、传感器配置&lt;/h2&gt;
&lt;p&gt;每一帧数据中，nuScenes 的传感器配置规格与部署位置如下：&lt;/p&gt;
&lt;h3 id=&#34;21-传感器规格&#34;&gt;2.1 传感器规格&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;摄像头（Camera）&lt;/strong&gt;：6 个环视摄像头，型号为 Basler ace acA1600-60gc（160 万像素），分别安装于车顶前部（CAM_FRONT）、左前（CAM_FRONT_LEFT）、右前（CAM_FRONT_RIGHT）、左侧（CAM_BACK_LEFT）、右侧（CAM_BACK_RIGHT）和后部（CAM_BACK）。每个摄像头输出 1600×900 像素 RGB 图像，帧率 12Hz，通过硬件同步实现同一时刻的全局快门采集。所有摄像头的水平视野之和覆盖 360°。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;激光雷达（LiDAR）&lt;/strong&gt;：1 个 Velodyne HDL-32E 32 线旋转式激光雷达，安装于车顶中心位置，垂直视野范围 -30° 至 +10°（共 40°），水平视野 360°，帧率 20Hz。每帧返回约 80 万个点，波长 905nm，最大探测距离约 100m。点云密度随距离增加而减小，近距离（&amp;lt; 20m）密度最高。&lt;/p&gt;</description>
    </item>
    <item>
      <title>Scaling Law与数据策略：训好大模型的工程法则</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/scaling-law%E4%B8%8E%E6%95%B0%E6%8D%AE%E7%AD%96%E7%95%A5/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/scaling-law%E4%B8%8E%E6%95%B0%E6%8D%AE%E7%AD%96%E7%95%A5/</guid>
      <description>模型越大越好是一个粗糙的直觉，实际工程中需要在计算预算、数据配比、模型容量之间找到最优平衡。本文讲解scaling law的核心公式与迁移规律、数据混合配比的经验法则、训练曲线异常诊断、以及VLA模型训练中的数据预处理Pipeline与curriculum learning策略。</description>
    </item>
    <item>
      <title>车端C&#43;&#43;开发实战：从Python原型到生产级代码</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%BD%A6%E7%AB%AFc&#43;&#43;%E5%BC%80%E5%8F%91%E5%AE%9E%E6%88%98/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%BD%A6%E7%AB%AFc&#43;&#43;%E5%BC%80%E5%8F%91%E5%AE%9E%E6%88%98/</guid>
      <description>自动驾驶车端代码必须用C++满足实时性要求，但研究团队往往只有Python经验。本文梳理从PyTorch原型到车端C++部署的关键转换：TensorRT C++ API调用、CUDA kernel手写优化、内存管理策略、线程安全与锁设计、以及车端常见的IPC通信机制。</description>
    </item>
    <item>
      <title>端到端驾驶评测指标全景</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%AB%AF%E5%88%B0%E7%AB%AF%E9%A9%BE%E9%A9%B6%E8%AF%84%E6%B5%8B%E6%8C%87%E6%A0%87%E5%85%A8%E6%99%AF/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%AB%AF%E5%88%B0%E7%AB%AF%E9%A9%BE%E9%A9%B6%E8%AF%84%E6%B5%8B%E6%8C%87%E6%A0%87%E5%85%A8%E6%99%AF/</guid>
      <description>&lt;h2 id=&#34;一引言&#34;&gt;一、引言&lt;/h2&gt;
&lt;p&gt;端到端自动驾驶模型的快速发展对评测体系提出了迫切需求。从早期的行为克隆论文仅报告 L2 位移误差，到如今 NAVSIM、nuPlan、Bench2Drive、CARLA 等多个基准各自定义复杂的复合指标，评测指标呈现出&amp;quot;从单一到综合、从开环到闭环、从粗粒度到细粒度&amp;quot;的演进趋势。&lt;/p&gt;
&lt;p&gt;然而，指标选择本身也成为了一个需要深思熟虑的问题——不同的指标反应驾驶质量的不同侧面，单一指标往往存在偏差。理解每个指标的设计动机、计算细节和局限性，是做出可信研究的必要条件。&lt;/p&gt;
&lt;p&gt;本文系统梳理端到端驾驶评测领域的主流指标，涵盖开环指标、闭环综合指标、按场景分解指标以及成功率等，并分析各指标之间的关联与互补关系。&lt;/p&gt;
&lt;h2 id=&#34;二开环评测指标&#34;&gt;二、开环评测指标&lt;/h2&gt;
&lt;p&gt;开环指标衡量模型预测轨迹与人类真值轨迹之间的差距，虽然不直接反映真实驾驶能力，但因其计算简单、可复现性强而被广泛使用。&lt;/p&gt;
&lt;h3 id=&#34;21-l1l2-位移误差&#34;&gt;2.1 L1/L2 位移误差&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;定义&lt;/strong&gt;：在未来时刻 t（通常取 1.0s、2.0s、3.0s）上，预测位置与真值位置之间的距离。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;公式&lt;/strong&gt;：&lt;/p&gt;



&lt;div class=&#34;goat svg-container &#34;&gt;
  
    &lt;svg
      xmlns=&#34;http://www.w3.org/2000/svg&#34;
      font-family=&#34;Menlo,Lucida Console,monospace&#34;
      
        viewBox=&#34;0 0 344 57&#34;
      &gt;
      &lt;g transform=&#39;translate(8,16)&#39;&gt;
&lt;path d=&#39;M 48,24 L 48,40&#39; fill=&#39;none&#39; stroke=&#39;currentColor&#39;&gt;&lt;/path&gt;
&lt;path d=&#39;M 56,-8 L 56,8&#39; fill=&#39;none&#39; stroke=&#39;currentColor&#39;&gt;&lt;/path&gt;
&lt;path d=&#39;M 144,8 L 144,24&#39; fill=&#39;none&#39; stroke=&#39;currentColor&#39;&gt;&lt;/path&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;0&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;L&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;0&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;A&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;0&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;F&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;8&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;2&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;8&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;D&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;8&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;D&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;16&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;_&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;16&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;E&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;16&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;E&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;24&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;32&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;=&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;32&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;=&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;40&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;=&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;56&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;1&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;56&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;|&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;64&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;|&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;64&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;/&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;64&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;P&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;72&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;P&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;72&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;T&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;72&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;_&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;80&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;_&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;80&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;)&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;80&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;p&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;88&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;p&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;88&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;r&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;96&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;r&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;96&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;×&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;96&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;e&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;104&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;e&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;104&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;d&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;112&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;d&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;112&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;Σ&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;112&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;(&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;120&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;(&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;120&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;_&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;120&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;T&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;128&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;128&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;128&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;)&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;136&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;)&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;144&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;-&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;152&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;-&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;152&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;|&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;160&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;P&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;160&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;P&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;168&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;P&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;168&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;_&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;168&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;_&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;176&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;_&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;176&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;p&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;176&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;g&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;184&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;g&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;184&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;r&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;184&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;192&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;192&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;e&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;192&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;(&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;200&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;(&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;200&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;d&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;200&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;T&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;208&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;208&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;(&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;208&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;)&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;216&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;)&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;216&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;216&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;|&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;224&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;|&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;224&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;|&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;232&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;|&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;232&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₂&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;240&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₂&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;240&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;-&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;256&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;P&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;264&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;_&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;272&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;g&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;280&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;288&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;(&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;296&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;304&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;)&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;312&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;|&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;320&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;|&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;328&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₂&lt;/text&gt;
&lt;/g&gt;

    &lt;/svg&gt;
  
&lt;/div&gt;
&lt;p&gt;&lt;strong&gt;解读&lt;/strong&gt;：L2 误差越小越好，但存在显著的饱和效应——当误差降到一定程度后，进一步降低 L2 未必意味着更好的驾驶能力。更严重的问题是：L2 误差对轨迹的&amp;quot;合理性&amp;quot;完全不敏感，一个不安全的急刹车轨迹和一个安全的平稳减速轨迹可能有相同的 L2 误差。此外，L2 误差也无法区分横向偏差和纵向偏差——偏离车道 0.5 米和速度偏差 5 km/h 可能产生相同的 L2 值。&lt;/p&gt;</description>
    </item>
    <item>
      <title>分布式训练的工程实践：从DeepSpeed到3D并行</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%88%86%E5%B8%83%E5%BC%8F%E8%AE%AD%E7%BB%83%E7%9A%84%E5%B7%A5%E7%A8%8B%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%88%86%E5%B8%83%E5%BC%8F%E8%AE%AD%E7%BB%83%E7%9A%84%E5%B7%A5%E7%A8%8B%E5%AE%9E%E8%B7%B5/</guid>
      <description>大模型训练需要分布式系统支持，但3D并行（数据并行/张量并行/流水线并行）的配置与调优极为复杂。本文从单卡训练痛点出发，系统讲解DeepSpeed的ZeRO stages、Megatron-LM的张量切片策略、流水线并行的micro-batch调度，以及VLA模型训练中activation checkpointing与通信拓扑选择的工程经验。</description>
    </item>
    <item>
      <title>开环评测 vs 闭环评测深度解析</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%BC%80%E7%8E%AF%E8%AF%84%E6%B5%8Bvs%E9%97%AD%E7%8E%AF%E8%AF%84%E6%B5%8B%E6%B7%B1%E5%BA%A6%E8%A7%A3%E6%9E%90/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%BC%80%E7%8E%AF%E8%AF%84%E6%B5%8Bvs%E9%97%AD%E7%8E%AF%E8%AF%84%E6%B5%8B%E6%B7%B1%E5%BA%A6%E8%A7%A3%E6%9E%90/</guid>
      <description>&lt;h2 id=&#34;一引言&#34;&gt;一、引言&lt;/h2&gt;
&lt;p&gt;在自动驾驶规划算法的研发流程中，评估方法的选择直接影响研究者对模型能力的判断。目前两类主流的评估范式——开环评测（Open-loop Evaluation）与闭环评测（Closed-loop Evaluation）——各有理论基础和适用范围，但二者之间存在显著的鸿沟。&lt;/p&gt;
&lt;p&gt;NAVSIM 论文《Can We Also Drive in Closed-loop?》通过系统性实证研究揭示了这一鸿沟的严重程度：开环评测中的 L2 误差与闭环驾驶质量之间的 Pearson 相关系数仅约 0.3。这意味着一个在开环评测中排名第一的模型，在真实闭环部署中可能完全不合格。越来越多的研究者开始呼吁抛弃&amp;quot;开环迷信&amp;quot;，转向更可靠的闭环评估或混合评估策略。&lt;/p&gt;
&lt;p&gt;本文将从原理、方法、指标和实证分析四个维度，全面解析这两种评测范式，帮助研究者在论文写作和模型选择中做出更准确的判断。&lt;/p&gt;
&lt;h2 id=&#34;二开环评测&#34;&gt;二、开环评测&lt;/h2&gt;
&lt;h3 id=&#34;21-基本定义&#34;&gt;2.1 基本定义&lt;/h3&gt;
&lt;p&gt;开环评测的核心流程如下：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从已录制的驾驶数据集中取出一个片段&lt;/li&gt;
&lt;li&gt;将历史观测数据（图像、点云、高精地图等）输入规划模型&lt;/li&gt;
&lt;li&gt;模型输出未来一段时间的 EGO 预测轨迹&lt;/li&gt;
&lt;li&gt;将预测轨迹与人类驾驶员在 log 中的实际轨迹（ground truth）进行比较&lt;/li&gt;
&lt;li&gt;计算误差指标&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;关键特征在于：&lt;strong&gt;评测过程中，模型不会接收到自身决策的反馈&lt;/strong&gt;。每一步的输入都来自真实 log 数据，与模型的预测无关。&lt;/p&gt;
&lt;h3 id=&#34;22-数据流示意&#34;&gt;2.2 数据流示意&lt;/h3&gt;



&lt;div class=&#34;goat svg-container &#34;&gt;
  
    &lt;svg
      xmlns=&#34;http://www.w3.org/2000/svg&#34;
      font-family=&#34;Menlo,Lucida Console,monospace&#34;
      
        viewBox=&#34;0 0 384 57&#34;
      &gt;
      &lt;g transform=&#39;translate(8,16)&#39;&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;0&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;0&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;0&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;t&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;8&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;=&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;8&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;=&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;8&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;=&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;16&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;0&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;16&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;1&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;16&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;2&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;24&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;:&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;24&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;:&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;24&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;:&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;40&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;观&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;40&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;观&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;40&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;观&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;48&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;测&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;48&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;测&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;48&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;测&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;64&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;x&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;64&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;x&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;64&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;x&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;72&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₀&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;72&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₁&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;72&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₂&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;88&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;→&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;88&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;→&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;88&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;→&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;104&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;模&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;104&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;模&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;104&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;模&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;112&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;型&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;112&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;型&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;112&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;型&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;128&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;→&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;128&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;→&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;128&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;→&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;144&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;预&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;144&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;预&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;144&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;预&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;152&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;测&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;152&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;测&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;152&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;测&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;168&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;ŷ&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;168&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;ŷ&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;168&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;ŷ&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;176&#39; y=&#39;4&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₀&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;176&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₁&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;176&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₂&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;200&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;（&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;200&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;（&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;208&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;x&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;208&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;x&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;216&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₁&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;216&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₂&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;232&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;来&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;232&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;来&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;240&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;自&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;240&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;自&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;256&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;l&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;256&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;l&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;264&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;o&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;264&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;o&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;272&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;g&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;272&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;g&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;280&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;，&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;280&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;，&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;288&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;与&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;288&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;与&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;304&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;ŷ&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;304&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;ŷ&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;312&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₀&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;312&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₀&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;320&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;、&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;328&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;无&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;328&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;ŷ&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;336&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;关&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;336&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;₁&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;344&#39; y=&#39;20&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;）&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;352&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;无&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;360&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;关&lt;/text&gt;
&lt;text text-anchor=&#39;middle&#39; x=&#39;368&#39; y=&#39;36&#39; fill=&#39;currentColor&#39; style=&#39;font-size:1em&#39;&gt;）&lt;/text&gt;
&lt;/g&gt;

    &lt;/svg&gt;
  
&lt;/div&gt;
&lt;p&gt;这种&amp;quot;教师强制（Teacher Forcing）&amp;ldquo;模式下，模型的一步预测误差不会传播到下一步——每一步都是独立比较。&lt;/p&gt;</description>
    </item>
    <item>
      <title>论文精读：FeaXDrive — Feasibility-aware Trajectory-Centric Diffusion Planning</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-12656/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-12656/</guid>
      <description>FeaXDrive 发现噪声中心扩散规划与轨迹可行性空间存在根本错位，提出轨迹中心扩散框架，通过自适应曲率正则化训练、可行驶区域引导推理和可行性感知 GRPO 后训练系统提升轨迹物理可行性。在 NAVSIM 上达 88.7 PDMS (IL) / 90.0 PDMS (RL)，曲率违反率从 8.59% 降至 0.88%。</description>
    </item>
    <item>
      <title>论文精读：Hydra-MDP — End-to-end Multimodal Planning with Multi-target Hydra-Distillation</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2406-06978/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2406-06978/</guid>
      <description>Hydra-MDP 提出多教师知识蒸馏框架，从人类示范教师（模仿人类轨迹）和规则教师（碰撞/可行驶区域等闭环指标）中同时学习，用多头解码器集成多样化轨迹候选。它以端到端可微分的方式统一了模仿学习和闭环指标优化，在 CVPR 2024 Navsim 挑战赛获得第一名，证明了多目标蒸馏范式在驾驶规划中的有效性。</description>
    </item>
    <item>
      <title>论文精读：UniDriveVLA — Mixture-of-Transformers 解耦感知-推理冲突的统一驾驶 VLA</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02190/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02190/</guid>
      <description>UniDriveVLA 提出 Mixture-of-Transformers 架构，通过理解/感知/规划三个专家解耦感知-推理冲突，结合 Masked Joint Attention 与稀疏感知范式，在 nuScenes 开环和 Bench2Drive 闭环上均达到 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜AutoDrive-P³：感知-预测-规划链式思维的统一强化微调——ICLR 2026 端到端驾驶新范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-28116/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-28116/</guid>
      <description>当前 VLM 驾驶方案要么直接输出规划缺失 CoT 推理，要么将感知-预测-规划割裂为独立模块缺乏协同。AutoDrive-P³ 提出统一链式思维框架，通过 P³-CoT 数据集构建感知→预测→规划的结构化推理链，再用 P³-GRPO 算法进行分层渐进式强化微调——将奖励从规划反传到感知和预测模块，实现三模块联合优化。在 NAVSIM 上达到 89.9 EPDMS，nuScenes 上取得最低碰撞率。</description>
    </item>
    <item>
      <title>论文精读｜DriveFuture：未来感知潜在世界模型——以未来状态条件化当前规划的 SOTA 范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-09701/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-09701/</guid>
      <description>现有潜在世界模型将未来状态视为预测目标而非规划条件，导致当前与未来特征纠缠。DriveFuture 提出以未来世界状态显式条件化当前决策的框架：训练时用 GT 未来潜在状态做条件，推理时用预测的未来状态接替，实现统一的规划导向 foresight 机制。在 NAVSIM v2 navhard 上以 55.5 EPDMS 排名第一，navtest 上达到 89.9 EPDMS 和 90.7 PDMS。</description>
    </item>
    <item>
      <title>论文精读｜Uni-World VLA — 交错世界建模与规划实现闭环交互驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-27287/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-27287/</guid>
      <description>现有世界模型通常先生成完整未来视频再规划（开环想象），但这种方式忽略了规划决策对环境的实时反馈。Uni-World VLA 提出交错生成范式——模型逐帧交替预测未来画面和自车动作，形成世界建模与控制的闭环交互。同时引入单目深度图作为几何线索增强空间感知。在 NAVSIM 上以单目 RGB 达到 89.4 PDMS，超越多传感器融合方法。</description>
    </item>
    <item>
      <title>数据闭环工程：从数据飞轮到持续迭代</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%95%B0%E6%8D%AE%E9%97%AD%E7%8E%AF%E5%B7%A5%E7%A8%8B/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E6%95%B0%E6%8D%AE%E9%97%AD%E7%8E%AF%E5%B7%A5%E7%A8%8B/</guid>
      <description>数据闭环是自动驾驶系统持续进化的核心引擎，但多数团队卡在「采了很多数据却不会用」的困境。数据闭环的核心难点不在于采集，而在于从PB级数据中精准定位那万分之一的corner case。本文拆解完整数据飞轮（采集→挖掘→标注→训练→评测→回灌），重点介绍主动学习采样策略（熵采样/多样性采样/不确定性估计）、场景库建设方法论、以及基于NeRF/3DGS的自动标注与数据增强前沿实践。</description>
    </item>
    <item>
      <title>知识精讲｜LiDAR点云处理基础</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/lidar%E7%82%B9%E4%BA%91%E5%A4%84%E7%90%86%E5%9F%BA%E7%A1%80/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/lidar%E7%82%B9%E4%BA%91%E5%A4%84%E7%90%86%E5%9F%BA%E7%A1%80/</guid>
      <description>系统讲解LiDAR工作原理（ToF、机械/固态）、点云表示方法（xyz、intensity、ring）、三类主流点云检测方法（voxel-based、point-based、range-view），以及在端到端检测中的典型方案（CenterPoint、TransFusion-L）。</description>
    </item>
    <item>
      <title>知识精讲｜相机成像原理与标定</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%9B%B8%E6%9C%BA%E6%88%90%E5%83%8F%E5%8E%9F%E7%90%86%E4%B8%8E%E6%A0%87%E5%AE%9A/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%9B%B8%E6%9C%BA%E6%88%90%E5%83%8F%E5%8E%9F%E7%90%86%E4%B8%8E%E6%A0%87%E5%AE%9A/</guid>
      <description>深入讲解自动驾驶中相机成像的核心原理，包括针孔模型、内参外参、畸变模型与标定流程，并分析相机标定质量对BEV感知与3D检测的影响，以及常见车载相机类型。</description>
    </item>
    <item>
      <title>知识精讲｜自动驾驶定位基础</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E5%AE%9A%E4%BD%8D%E5%9F%BA%E7%A1%80/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E5%AE%9A%E4%BD%8D%E5%9F%BA%E7%A1%80/</guid>
      <description>系统讲解自动驾驶定位技术核心：GNSS/RTK、IMU、车轮里程计的基本原理，卡尔曼滤波的预测-更新过程，多传感器融合的松耦合与紧耦合方案，以及基于HD地图与点云匹配的定位方法，并分析VLA时代定位技术的新角色。</description>
    </item>
    <item>
      <title>论文精读：Bench2Drive — Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2406-03877/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2406-03877/</guid>
      <description>现有端到端自动驾驶评测存在开环指标不可靠、长路线闭环方差大、缺乏统一训练集三大问题。Bench2Drive 由上海交通大学提出，是首个面向多维度驾驶能力的闭环评测基准，提供 200 万帧统一标注训练数据与 220 条短路线多技能评估协议。实验表明开环 L2 误差与闭环驾驶分数相关性极弱（Pearson r=0.03），专家特征蒸馏与细粒度能力评估是提升端到端自动驾驶的关键方向。</description>
    </item>
    <item>
      <title>论文精读：BEV-VAE — Multi-View Image Generation with Spatial Consistency</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2507-00707/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2507-00707/</guid>
      <description>现有自动驾驶多视角生成方法缺乏显式3D建模，仅将问题视为2D图像集合成。BEV-VAE提出在BEV隐空间中进行编码与生成，通过多视角VAE构造统一BEV表征，再以DiT进行潜扩散生成。在nuScenes和Argoverse 2上，BEV-VAE实现了高保真重建与3D一致的多视角生成，并支持新视角合成与3D布局可控生成。</description>
    </item>
    <item>
      <title>论文精读：TOAD — Test-Time Trajectory Optimization for Autonomous Driving</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-07170/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-07170/</guid>
      <description>端到端自动驾驶规划器通常先生成候选轨迹再评分，但评分器无法影响候选集本身，弱候选集会限制性能。TOAD将评分器重新定义为学习到的轨迹级奖励函数，在测试时使用交叉熵方法（CEM）搜索最大化该奖励的轨迹，无需重训练即可即插即用。在NAVSIM-v1（94.7 PDMS）、NAVSIM-v2（56.3 EPDMS）和闭环HUGSIM基准上，TOAD一致提升了六种基规划器的表现，并深入分析了评分器泛化能力对测试时搜索的关键影响。</description>
    </item>
    <item>
      <title>论文精读：WorldVLA — Towards Autoregressive Action World Model</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-21539/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-21539/</guid>
      <description>WorldVLA 提出统一的自回归动作世界模型，将VLA与世界模型融合在单一LLM框架中。通过三种模态的离散token共享词汇表实现图像/文本/动作的全统一，并提出动作注意力掩码解决长序列动作块的误差累积问题。在LIBERO基准上动作成功率提升4%、FVD降低10%，证实世界模型与动作模型的双向增强。</description>
    </item>
    <item>
      <title>论文精读｜CLOVER：闭环价值估计与排序框架——端到端自动驾驶规划的生成-打分新范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-15120/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-15120/</guid>
      <description>端到端自动驾驶规划器的训练（模仿单条轨迹）与评测（规则化指标）存在根本性错配。CLOVER 提出轻量级生成器-打分器架构，通过构造评估器过滤的伪专家轨迹实现集合级覆盖训练，再以保守闭环自蒸馏交替优化生成器与打分器。在 NAVSIM 上达到 94.5 PDMS 和 90.4 EPDMS，刷新 SOTA，并提供了不完备打分器仍能提升生成器的理论保证。</description>
    </item>
    <item>
      <title>论文精读｜ReWorld — 面向 World Action Model 的表征学习</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-27504/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-27504/</guid>
      <description>现有 World Action Model 仅通过输出端损失间接塑造中间表征，导致世界知识无法有效传递到规划模块。ReWorld 首次提出面向自动驾驶 WAM 的表征学习框架，通过未来预测监督、跨模态对齐和硬负样本排斥三个维度直接优化中间表征，在 nuScenes 上将 FVD 从 81.3 降至 61.9（降幅 23.9%），在 NAVSIM 上将闭环 PDMS 从 89.1 提升至 90.4 且无需 RL 后训练。</description>
    </item>
    <item>
      <title>论文精读｜X-World — 可控多相机世界模型实现可扩展端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-19979/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-19979/</guid>
      <description>端到端自动驾驶面临评测成本高、场景覆盖有限、难以复现的瓶颈。X-World 提出了一种以自我为中心的多视角生成式世界模型，通过动作条件化的多相机视频生成实现可控闭环仿真，在动作跟随度、跨视角一致性和长时序稳定性上取得了突破性表现。论文详细设计了两阶段级联训练策略、视角-时序自注意力机制和异构条件注入方案，为 VLA 系统的可扩展闭环评测与仿真训练提供了完整基础设施。</description>
    </item>
  </channel>
</rss>
