<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>论文精读 on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/categories/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB/</link>
    <description>Recent content in 论文精读 on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Mon, 07 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/categories/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>论文精读｜LinkVLA：统一语言-动作理解与生成的 VLA 架构</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/linkvla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/linkvla%E7%B2%BE%E8%AF%BB/</guid>
      <description>LinkVLA 提出将语言指令和驾驶轨迹统一到共享离散词表的 VLA 架构，通过对数坐标变换+空间软标签实现连续轨迹的离散化，引入动作理解反向目标建立双向语义映射，并用 C2F 两步解码替代逐点自回归。在 Bench2Drive (CARLA v2) 上 DS 达 91.01（超 SimLingo 5.94 分，+6.98%），推理延迟从 361ms 降到 48ms。主要作者来自浙大和理想汽车，收录于 CVPR 2026。</description>
    </item>
    <item>
      <title>论文精读｜DriveVLM：把大语言模型推理能力搬上自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevlm%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevlm%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveVLM 是首个系统性地把视觉语言模型用于自动驾驶场景理解与推理的工作。它提出双系统架构——VLM 慢系统做思维链推理输出高层决策，传统规划器快系统做安全执行。在 CARLA 闭环评测中大幅超越基线，为 VLA 的 Dual-System 范式奠定基础。</description>
    </item>
    <item>
      <title>论文精读｜ST4VLA：空间引导训练实现鲁棒的视觉-语言-动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/st4vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/st4vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>ST4VLA 提出双阶段空间引导训练框架：第一阶段用点、框、轨迹预测进行空间接地预训练注入空间先验；第二阶段用空间提示引导动作生成。在 SimplerEnv 上 Google Robot 从 66.1 提升到 84.6，WidowX 从 54.7 提升到 73.2，并展现对未见物体和复杂长时任务的强泛化。</description>
    </item>
    <item>
      <title>论文精读｜π0：基于Flow Matching的通用视觉-语言-动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/pi0-%E9%80%9A%E7%94%A8vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/pi0-%E9%80%9A%E7%94%A8vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>π0 用预训练 VLM 做大脑、Flow Matching 做动作头，开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单，相比离散化精度更高，巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练，一个模型搞定从叠衣服到收桌子的多种高难度操作。</description>
    </item>
    <item>
      <title>论文精读｜NoRD：无需推理的高效数据驱动 VLA</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/nord%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/nord%E7%B2%BE%E8%AF%BB/</guid>
      <description>NoRD 挑战 VLA 对大规模数据和推理标注的依赖，仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差（Difficulty Bias）失效，引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。</description>
    </item>
    <item>
      <title>论文精读｜UniAD：面向规划的端到端自动驾驶框架（CVPR 2023最佳论文）</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/uniad-%E7%AB%AF%E5%88%B0%E7%AB%AF%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E6%A1%86%E6%9E%B6%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/uniad-%E7%AB%AF%E5%88%B0%E7%AB%AF%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E6%A1%86%E6%9E%B6%E7%B2%BE%E8%AF%BB/</guid>
      <description>UniAD 首次将感知、预测、规划全部统一进一个可端到端联合训练的网络，以规划为最终目标反向驱动所有中间任务。它开创了显式端到端新范式，每个模块输出可解释的中间表示，并通过规划导向的联合优化全面提升系统一致性。获 CVPR 2023 最佳论文奖，是自动驾驶端到端路线里程碑式的奠基工作。</description>
    </item>
    <item>
      <title>论文精读｜DriveVLA-M0：失败感知的记忆增强，让 VLA 学会吃一堑长一智</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevla-m0%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevla-m0%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveVLA-M0 给 VLA 自动驾驶加上了&amp;rsquo;失败记忆&amp;rsquo;：离线把模型表现差的场景连同路网/交互结构特征写进 latent memory，在线用专用的 Retrieve Model 检索结构相似的失败案例，再用解耦 LoRA 做测试时训练（TTT）逐场景纠正，让模型&amp;rsquo;吃一堑长一智&amp;rsquo;。NAVSIMv1 上 94.1 PDMS、NAVSIMv2 上 47.0 EPDMS，TTT 后向开销仅 26.44ms。它与同系 DriveVLA-W0 走了完全相反的路：W0 用世界模型换&amp;rsquo;稠密监督&amp;rsquo;，M0 用失败记忆换&amp;rsquo;场景自适应&amp;rsquo;。</description>
    </item>
    <item>
      <title>论文精读｜VLA Safety Survey：视觉-语言-动作模型安全的全面综述</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vla%E5%AE%89%E5%85%A8%E7%BB%BC%E8%BF%B0%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vla%E5%AE%89%E5%85%A8%E7%BB%BC%E8%BF%B0%E7%B2%BE%E8%AF%BB/</guid>
      <description>这是首篇系统梳理 VLA 安全的综述，从攻击时机（训练时/推理时）和防御时机（训练时/推理时）两条平行轴组织文献，涵盖数据投毒、后门攻击、对抗补丁、跨模态扰动、语义越狱等威胁及对应防御，并讨论了 6 大部署领域的安全挑战。</description>
    </item>
    <item>
      <title>论文精读｜AutoVLA：用自适应推理与 GRPO 微调统一「思考」与「动作」的端到端 VLA</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/autovla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/autovla%E7%B2%BE%E8%AF%BB/</guid>
      <description>AutoVLA（NeurIPS 2025, UCLA）把「链式推理 CoT」与「物理动作 token 化」塞进同一个自回归生成模型，用一套代码本把连续轨迹离散成可行动作，再用 SFT 训练出快思考（只出轨迹）与慢思考（带 CoT 推理）双模式，最后用 GRPO 强化微调在简单场景关掉多余推理。它是 NAVSIM v1 上 VLA 路线的代表基线（PDMS 89.1 / 92.1+锚点），也是 DriveVLA-W0 的主要对比对象。</description>
    </item>
    <item>
      <title>论文精读｜DriveVLA-W0：世界模型放大自动驾驶数据缩放律</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevla-w0%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevla-w0%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveVLA-W0 用世界模型给 VLA 大模型补上稠密监督，解决了大参数模型仅用稀疏轨迹信号训练的&amp;rsquo;监督赤字&amp;rsquo;问题。它同时预测未来动作和未来图像，用像素级稠密监督逼模型学懂物理动力学。单目前视相机即刷新 NAVSIM 榜单，证明了&amp;rsquo;世界模型放大数据缩放律&amp;rsquo;的路线可行性。</description>
    </item>
    <item>
      <title>论文精读｜DLWM：双潜在世界模型实现高斯中心的全方位预训练</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/dlwm%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/dlwm%E7%B2%BE%E8%AF%BB/</guid>
      <description>DLWM 提出双阶段自监督预训练范式：第一阶段用多视图语义和深度重建学习 3D 高斯场景表示；第二阶段训练双潜在世界模型——高斯流引导的潜在预测（占据感知/预测）和自车规划引导的潜在预测（运动规划）。在 nuScenes 上占据预测 +1.02 mIoU，规划 L2 误差降低 16%。</description>
    </item>
    <item>
      <title>论文精读｜AlpaMayo-R1：因果推理链 &#43; RL 驱动的 VLA 驾驶策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/alpamayo-r1%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/alpamayo-r1%E7%B2%BE%E8%AF%BB/</guid>
      <description>NVIDIA 提出 AlpaMayo-R1，一个融合 Chain of Causation 因果推理与 GRPO 强化学习的 VLA 模型。它基于 Cosmos-Reason VLM 骨干，通过结构化 CoC 数据集实现决策锚定的因果推理，利用 Flow Matching 动作解码器生成连续轨迹。三阶段训练（动作注入→推理微调→RL后训练）在长尾场景中取得显著提升：规划准确率 +12%，近距离冲突率 -35%，推理质量 +45%。真车路测延迟仅 99ms。</description>
    </item>
    <item>
      <title>论文精读｜RAW2Drive：对齐世界模型的强化学习端到端驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/raw2drive%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/raw2drive%E7%B2%BE%E8%AF%BB/</guid>
      <description>RAW2Drive 提出双流模型基强化学习框架，先用特权信息（BEV 语义）高效训练特权世界模型+策略，再通过对齐机制引导原始传感器世界模型的学习，实现首个从原始传感器直接规划端到端 MBRL 方法。在 Bench2Drive 上 DS 达 83.5，超越所有原始传感器基线。</description>
    </item>
    <item>
      <title>论文精读｜NVIDIA Cosmos 3：全模态世界基础模型开启物理AI新纪元</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/cosmos3-%E4%B8%96%E7%95%8C%E5%9F%BA%E7%A1%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/cosmos3-%E4%B8%96%E7%95%8C%E5%9F%BA%E7%A1%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构将语言、图像、视频、音频、动作五模态统一进单一世界基础模型。Reasoner 塔负责语义推理，Generator 塔负责高保真生成，两塔通过共享跨模态注意力深度耦合。在 8 项物理 AI 基准上取得开放模型第一，并以 OpenMDW-1.1 宽松许可证开源。</description>
    </item>
    <item>
      <title>论文精读｜Percept-WAM：把 2D/3D 感知&#39;种&#39;进 VLM 里的感知增强世界动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/percept-wam%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/percept-wam%E7%B2%BE%E8%AF%BB/</guid>
      <description>Percept-WAM 回答的是 WAM 系列的另一个致命问题：VLM 的空间感太差——&amp;lsquo;定位漂移、时序不一致、置信度虚高&amp;rsquo;，导致 VLA 系统的感知和规划都不稳。它把 2D/3D 感知任务直接&amp;rsquo;种&amp;rsquo;进单个 VLM 里：用 World-PV token（透视视角）和 World-BEV token（鸟瞰视角）编码可定位的世界状态，配合网格条件化预测头、IoU 校准置信度和并行自回归解码，再用四组点级 query（Q_pv/Q_bev/Q_ego/Q_full）把感知表示对齐成轨迹。NAVSIM v1 拿到 90.2 PDMS，超过 DiffusionDrive 2.1，还配了流式推理把时延压到 707ms。</description>
    </item>
    <item>
      <title>论文精读｜MOSAIC：面向端到端自动驾驶的缩放感知数据选择</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/mosaic%E6%95%B0%E6%8D%AE%E9%80%89%E6%8B%A9%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/mosaic%E6%95%B0%E6%8D%AE%E9%80%89%E6%8B%A9%E7%B2%BE%E8%AF%BB/</guid>
      <description>MOSAIC 提出三阶段数据选择框架：聚类分域 → 拟合神经缩放定律 → 迭代选择最大化指标边际增益。在 NAVSIM 上使用 Hydra-MDP 模型，以 42% 更少数据达到全量训练性能，EPDMS 最优。来自 NVIDIA 和 NYU 的 CVPR 2026 工作。</description>
    </item>
    <item>
      <title>论文精读｜SparseDriveV2：Scoring is All You Need——可扩展轨迹词表与打分</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/sparsedrive-v2%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/sparsedrive-v2%E7%B2%BE%E8%AF%BB/</guid>
      <description>SparseDriveV2 把&amp;rsquo;打分式规划&amp;rsquo;推向极致：把时空轨迹分解成几何路径✕速度剖面两份词表，用组合式构图构造出比此前稠密 32 倍的超密集轨迹词表；再配合&amp;rsquo;粗粒度分解打分 + 细粒度组合打分&amp;rsquo;的可扩展打分策略，让打分计算量与词表大小解耦。在 NAVSIM v2 上达到 90.1 EPDMS，位居打分式与生成式方法的 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜BrainWAM：大脑式&#39;动作空间协调&#39;——把 VLA 语义先验和 WAM 预测动态拧成一股绳</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/brainwam%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/brainwam%E7%B2%BE%E8%AF%BB/</guid>
      <description>BrainWAM 用&amp;rsquo;大脑分工&amp;rsquo;的思路回答一个根本问题：VLA（语义推理）和 WAM（预测动态）到底该怎么结合？它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号；再受左右脑半球经胼胝体通信、小脑协调运动意图的启发，把语义和预测拆成两条特化通路，各自产出&amp;rsquo;面向动作&amp;rsquo;的表示，最后在紧凑的动作空间里用 CAB（胼胝体动作桥）双向交换、CIF（小脑意图融合）协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS，双双超过 VLA-only、WAM-only 和 Tri-MoT。</description>
    </item>
    <item>
      <title>论文精读｜Metis：用&#39;非对称注意力掩码&#39;把视频生成与动作预测解耦的世界动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/metis%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/metis%E7%B2%BE%E8%AF%BB/</guid>
      <description>Metis 用 Mixture-of-Transformers 把&amp;rsquo;视频生成专家&amp;rsquo;和&amp;rsquo;动作预测专家&amp;rsquo;拆成两个独立 Transformer，再用一张非对称注意力掩码管理二者的信息流：动作只看向当前帧，未来视频可以看动作。训练时联合优化两者学到世界动态，推理时直接跳过视频生成只跑动作分支——NAVSIM-v2 navhard/navtest 和 CityWalker 全面 SOTA，纯动作推理比带视频快 8 倍，还零样本部署到四足机器人。</description>
    </item>
    <item>
      <title>论文精读｜SimWAM：把世界模型当&#39;训练老师&#39;，用 Flow-GRPO 让 Action Expert 学会&#39;自己开车&#39;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/simwam%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/simwam%E7%B2%BE%E8%AF%BB/</guid>
      <description>SimWAM 用 joint flow matching 把预训练视频专家的交通动态先验&amp;rsquo;蒸馏&amp;rsquo;进轻量级 Action Expert，再用隔离注意力掩码让动作分支彻底摆脱未来帧依赖；随后把确定性 Flow ODE 转成可探索的 SDE，用 GRPO 直接优化 NAVSIM 组合驾驶奖励，突破模仿学习的上限。91.5 PDMS 新 SOTA，推理时延大幅低于 imagine-then-act 的 WAM，并零样本迁移到 nuScenes。</description>
    </item>
    <item>
      <title>论文精读｜DiffusionDrive：扩散模型驱动的端到端轨迹规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusiondrive%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusiondrive%E7%B2%BE%E8%AF%BB/</guid>
      <description>DiffusionDrive 将扩散模型引入自动驾驶轨迹规划，从噪声出发逐步去噪生成多条合理轨迹，解决了确定性回归的 mode averaging 痛点。它通过轨迹初始化先验和截断扩散策略大幅减少采样步数，让扩散规划真正跑在车端。在闭环评测中达到生成式端到端驾驶的领先水平。</description>
    </item>
    <item>
      <title>论文精读｜ReCogDrive：小米EV强化认知端到端自动驾驶框架</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/recogdrive%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/recogdrive%E7%B2%BE%E8%AF%BB/</guid>
      <description>华科×小米EV 提出 ReCogDrive，将 VLM 认知推理（场景理解与决策分析）、扩散规划器（连续轨迹生成）和 DiffGRPO 强化学习（安全优化）三阶段统一。它的层级化数据流水线自动生成含推理链的 VQA 标注，解决了 VLM&amp;rsquo;会想但不会开&amp;rsquo;的模态错配问题。在 NAVSIM 和 Bench2Drive 上达到 SOTA，验证了&amp;rsquo;认知-规划-优化&amp;rsquo;三分天下的 VLA 设计范式。</description>
    </item>
    <item>
      <title>论文精读｜Qwen-Drive-1.0：阿里通义首个驾驶视觉-语言基础模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/qwen-drive-1/</link>
      <pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/qwen-drive-1/</guid>
      <description>Qwen-Drive-1.0 基于 Qwen3.5-4B VLM 外挂两个模块：BEV感知头（3D检测+占用预测+地图分割）和 Planning Expert（~1.1B 参数 Flow Matching 轨迹生成器），四阶段渐进训练。关键设计：&lt;strong&gt;不设推理时打分器&lt;/strong&gt;，直接用 Flow Matching 单次采样输出轨迹，RL 后训练用 GRPO 式分组优势优化。NAVSIM v1.1 榜上 90.7 PDMS（RL），WOD-E2E 7.91 RFS，AlpaSim 闭环 0.37 分。</description>
    </item>
    <item>
      <title>论文精读｜SparseOccVLA：稀疏占用查询桥接 Occupancy 与 VLM，实现统一 4D 场景理解与规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/sparseoccvla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 27 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/sparseoccvla%E7%B2%BE%E8%AF%BB/</guid>
      <description>SparseOccVLA 用稀疏占用查询作为视觉与语言之间的单一桥梁，彻底摆脱 ViT patch token，让 LLM 在统一框架内同时完成场景理解、占用预测和轨迹规划。在 OmniDrive-nuScenes 上 CIDEr 提升 7%，Occ3D-nuScenes mIoU 提升 0.5，nuScenes 规划指标达 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜Qwen-VLA：阿里通义千问统一视觉-语言-动作基础模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/qwen-vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/qwen-vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>阿里 Qwen-VLA 用&amp;rsquo;认知主干+运动专家&amp;rsquo;双模块解耦架构（类比大脑皮层与小脑分工），将操作、导航、轨迹预测三类异构具身决策问题统一进同一模型。它采用 T2A→CPT→SFT→RL 四阶段渐进训练策略，稳定解决预训练 VLM 与随机初始化 DiT 动作解码器的不对称训练问题。在多机器人本体和多任务家族上展现一致跨任务性能与强分布外泛化。</description>
    </item>
    <item>
      <title>论文精读｜CARLA: An Open Urban Driving Simulator —— 自动驾驶仿真的事实标准</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-1711-03938/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-1711-03938/</guid>
      <description>CARLA 是首个从头构建、开源开放的城市场景驾驶仿真器，基于 Unreal Engine 4 实现了高保真渲染、灵活传感器配置和标准化基准评测。本文从架构设计、实验基准到历史影响全面拆解这篇 CoRL 2017 经典论文，并分析其如何成为自动驾驶研究的事实标准平台。</description>
    </item>
    <item>
      <title>论文精读｜RT-1：Robotics Transformer——大规模真实机器人数据驱动的策略学习</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-1-robotics-transformer%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-1-robotics-transformer%E7%B2%BE%E8%AF%BB/</guid>
      <description>RT-1是Google Robotics团队提出的一种基于Transformer的机器人策略模型，通过在超过13万条真实机器人轨迹数据上训练，实现了对700+种任务的强大泛化能力。该工作首次证明了大规模、多样化的真实数据结合高容量架构能够在机器人领域取得类似NLP和CV领域的scalable性能。</description>
    </item>
    <item>
      <title>论文精读｜EMMA：Waymo的多模态端到端驾驶大模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/emma-wayve%E7%AB%AF%E5%88%B0%E7%AB%AF%E5%A4%9A%E6%A8%A1%E6%80%81%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/emma-wayve%E7%AB%AF%E5%88%B0%E7%AB%AF%E5%A4%9A%E6%A8%A1%E6%80%81%E7%B2%BE%E8%AF%BB/</guid>
      <description>Waymo 的 EMMA 基于 Gemini 多模态大模型，把所有驾驶任务（感知、预测、规划）统一翻译成自然语言 VQA，用单一模型、一套语言空间端到端处理。它选择直接文本化坐标以最大化复用 Gemini 预训练的世界知识。代表了将 MLLM 作为驾驶系统&amp;rsquo;一等公民&amp;rsquo;的前沿探索。</description>
    </item>
    <item>
      <title>论文精读｜PaLM-E：具身多模态语言模型——让机器人理解真实世界</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/palm-e%E5%85%B7%E8%BA%AB%E5%A4%9A%E6%A8%A1%E6%80%81%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/palm-e%E5%85%B7%E8%BA%AB%E5%A4%9A%E6%A8%A1%E6%80%81%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>PaLM-E是Google与柏林工业大学联合提出的具身多模态语言模型，将PaLM大语言模型与视觉编码器结合，直接处理机器人传感器数据。该模型在562B参数规模下不仅在机器人任务上表现出色，还在OK-VQA等视觉语言基准上达到SOTA，同时保留了强大的语言能力。</description>
    </item>
    <item>
      <title>论文精读｜GoalFlow：目标引导流匹配轨迹生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/goalflow%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/goalflow%E7%B2%BE%E8%AF%BB/</guid>
      <description>GoalFlow 用一个精准目标点词表加评分机制选出最合理的短期终点，再用 Flow Matching 一步生成多模态驾驶轨迹。它解决了纯扩散生成轨迹发散无边界、而固定锚点约束过强不真实的两难问题。在 NAVSIM 上 PDMS 达到 90.3，验证了&amp;rsquo;目标点+整流流&amp;rsquo;高效生成方案的有效性。</description>
    </item>
    <item>
      <title>论文精读｜SayCan：让大型语言模型在机器人上落地执行</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/saycan%E8%AF%AD%E8%A8%80-grounding%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/saycan%E8%AF%AD%E8%A8%80-grounding%E7%B2%BE%E8%AF%BB/</guid>
      <description>SayCan是Google提出的将大型语言模型与机器人技能结合的方法，通过将LLM的语言知识与机器人技能的可行性（affordance）结合，实现了自然语言指令到长horizon机器人任务的规划与执行。该工作首次展示了LLM如何在真实机器人上落地，开启了LLM+机器人的新范式。</description>
    </item>
    <item>
      <title>论文精读｜VAD：向量化端到端自动驾驶的效率革命</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vad%E5%90%91%E9%87%8F%E5%8C%96%E7%AB%AF%E5%88%B0%E7%AB%AF%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vad%E5%90%91%E9%87%8F%E5%8C%96%E7%AB%AF%E5%88%B0%E7%AB%AF%E7%B2%BE%E8%AF%BB/</guid>
      <description>VAD 将整个驾驶场景建模为全向量化表示——地图元素和 agent 运动都变成矢量，彻底抛弃了 UniAD 中的稠密栅格。它通过隐式 query 交互和显式三个向量化规划约束，在保持精度的同时将推理速度提升 2.5-9.3 倍。作为 UniAD 之后最重要的效率改进工作，VAD 为端到端驾驶的实时部署铺平了道路。</description>
    </item>
    <item>
      <title>论文精读｜Gato：DeepMind的通用智能体——一个网络玩转604种任务</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/gato%E9%80%9A%E7%94%A8%E6%99%BA%E8%83%BD%E4%BD%93%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/gato%E9%80%9A%E7%94%A8%E6%99%BA%E8%83%BD%E4%BD%93%E7%B2%BE%E8%AF%BB/</guid>
      <description>Gato是DeepMind提出的通用智能体，通过在604种不同任务上联合训练，用一个Transformer网络同时处理 Atari 游戏、机器人控制、图像描述、文本对话等任务。它证明了单一模型可以掌握多种模态的技能，是迈向通用人工智能的重要一步。</description>
    </item>
    <item>
      <title>论文精读｜DriveVLM-W0 与 DriveWLM 系列：世界模型如何点亮驾驶大模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevlm-w0%E4%B8%8Edrivewlm%E7%B3%BB%E5%88%97%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivevlm-w0%E4%B8%8Edrivewlm%E7%B3%BB%E5%88%97%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveVLM 家族从语言 CoT 演进到世界模型统一建模范式，攻克了 VLM 上车面临的监督稀疏、世界与动作割裂、探索不安全三道坎。DrivingGPT 用 VQ-VAE 把图像与动作离散化为统一词表，将驾驶建模为 next-token 预测。DriveVLM-RL 借鉴神经科学双通路机制，用离线 RL 为驾驶安全兜底。</description>
    </item>
    <item>
      <title>论文精读｜Open X-Embodiment：跨机器人大规模数据集与RT-X模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/open-x-embodiment%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/open-x-embodiment%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>Open X-Embodiment是Google联合21家机构打造的跨机器人大规模数据集，包含22种机器人、100万+轨迹数据。基于该数据集训练的RT-X模型首次证明了跨机器人正迁移的可行性，RT-1-X成功率提升50%，RT-2-X泛化能力提升3倍。</description>
    </item>
    <item>
      <title>论文精读｜Diffusion Planner：把轨迹规划重定义为扩散式未来生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-planner%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-planner%E7%B2%BE%E8%AF%BB/</guid>
      <description>Diffusion Planner 把自动驾驶规划重定义为未来轨迹生成任务，用 Diffusion Transformer（DiT）将自车规划与他车预测联合建模为一次条件去噪过程。它通过免训练的分类器引导机制在推理时灵活注入安全、舒适与速度偏好。在 nuPlan 闭环评测中刷新 SOTA，开创了扩散式联合预测-规划的新范式。</description>
    </item>
    <item>
      <title>论文精读｜DROID：大规模真实世界机器人操作数据集</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/droid%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%93%8D%E4%BD%9C%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/droid%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%93%8D%E4%BD%9C%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>DROID是Google联合18家机构打造的大规模真实世界机器人操作数据集，包含76k演示轨迹、564个场景、86个任务，跨越北美、亚洲、欧洲三大洲。实验证明使用DROID训练的策略在性能和泛化能力上平均提升20%。</description>
    </item>
    <item>
      <title>论文精读｜MAN TruckScenes — 第一个面向重卡自动驾驶的多模态数据集，把 4D 雷达做成 360° 全覆盖</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-mantruckscenes/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-mantruckscenes/</guid>
      <description>MAN TruckScenes 是 MAN Truck &amp;amp; Bus 与慕尼黑工业大学在 NeurIPS 2024 Datasets &amp;amp; Benchmarks 提出的第一个面向自动驾驶重卡的多模态数据集，含 747 个 20 秒场景、4 相机 + 6 激光雷达 + 6 个 4D 雷达 + 双 IMU + 高精度 GNSS，标注范围超 230 米、27 个物体类、34 个场景标签，并首次提供 360° 覆盖的 4D 雷达点云与带 3D 框标注，配套 nuScenes 格式 devkit 与 CenterPoint/RadarGNN/PETR 基线。本文面向刚入行的 VLA 工程师，用大白话拆解它的传感器布局、卡车特有挑战、标注与切分、以及给端到端重卡模型带来的长距离鲁棒感知问题。</description>
    </item>
    <item>
      <title>论文精读｜AlphaDrive：GRPO 强化学习唤醒驾驶推理与多模态规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/alphadrive-grpo%E9%A9%BE%E9%A9%B6%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/alphadrive-grpo%E9%A9%BE%E9%A9%B6%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>AlphaDrive 把 DeepSeek R1 式的 GRPO 推理强化学习首次引入自动驾驶规划，将高层驾驶决策建模为元动作分类问题。它设计了四个面向规划的专门奖励，配合 SFT 预热+RL 探索两阶段策略。仅 2B 参数的 Qwen2VL 模型反超 7B 系列，并涌现出&amp;rsquo;一景多解&amp;rsquo;的多模态规划能力。</description>
    </item>
    <item>
      <title>论文精读｜RH20T：面向拟人全身控制的机器人操作数据集</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rh20t%E6%8B%9F%E4%BA%BA%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rh20t%E6%8B%9F%E4%BA%BA%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>RH20T是上海交通大学推出的超大规模机器人操作数据集，包含110,000+条接触丰富的真实世界操作序列，覆盖147项任务、7种机器人配置。数据集提供视觉、力觉、音频等多模态信息，支持一次性模仿学习研究。</description>
    </item>
    <item>
      <title>论文精读｜Sparse4D：全稀疏多摄像头 3D 感知的三连击</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/sparse4d%E7%A8%80%E7%96%8F%E6%84%9F%E7%9F%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/sparse4d%E7%A8%80%E7%96%8F%E6%84%9F%E7%9F%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>Sparse4D 用全稀疏范式挑战 BEV 感知路线：用稀疏实例 query 直接从多相机图像抠出 3D 目标，绕开计算昂贵的稠密 BEV 特征图。它通过稀疏 4D 关键点采样、循环时序融合和实例去噪三项核心设计，将多摄像头 3D 检测与跟踪做到 nuScenes 顶尖。作为全稀疏感知范式奠基作，后续 SparseDrive 系列在此基础上构建端到端驾驶系统。</description>
    </item>
    <item>
      <title>论文精读｜Octo：开源通用机器人策略——大规模多任务机器人基础模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/octo%E9%80%9A%E7%94%A8%E6%9C%BA%E5%99%A8%E4%BA%BA%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/octo%E9%80%9A%E7%94%A8%E6%9C%BA%E5%99%A8%E4%BA%BA%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>Octo 是 UC Berkeley 等团队推出的开源通用机器人策略（GRP），基于 Transformer 架构在 80 万条多机器人轨迹上预训练，支持语言指令和目标图像双模式输入，可通过高效微调适配新机器人平台和动作空间。作为首个完全开源的通用机器人操控策略，Octo 为机器人基础模型的研究奠定了重要基础。</description>
    </item>
    <item>
      <title>论文精读｜Last-VLA：小米的视觉-语言-动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/last-vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/last-vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>LaST-VLA 把 VLA 推理从文字 CoT 搬进连续隐空间，用 3D 几何先验（VGGT）和世界模型动力学先验（Cosmos）两个外部基础模型当特征级老师，蒸馏监督隐 CoT。它让隐式推理既绕开了文字 CoT 的慢速与幻觉问题，又避免了朴素隐 CoT 的物理脱节。在 NAVSIM 双榜单上用单目前视传感器取得 SOTA，推理时两个老师全部旁路、零额外开销。</description>
    </item>
    <item>
      <title>论文精读｜OpenVLA：开源视觉-语言-动作模型——VLA走向开放生态</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/openvla%E5%BC%80%E6%BA%90vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/openvla%E5%BC%80%E6%BA%90vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型，在 97 万条真实机器人演示上训练，以 7 倍更少的参数超越闭源模型 RT-2-X（55B）。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干，结合 LoRA 微调和量化推理，OpenVLA 让 VLA 模型首次走向开放生态。</description>
    </item>
    <item>
      <title>论文精读｜One-VL：小米统一视觉语言模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/one-vl%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/one-vl%E7%B2%BE%E8%AF%BB/</guid>
      <description>小米 OneVL 用双模态隐式推理超越显式 CoT，攻克了隐式推理长期打不过显式 CoT 的困境。它将 55 个紧致隐 token（35 视觉+20 语言）作为信息瓶颈，用语言解码器还原语义 CoT、视觉世界模型解码器预测未来帧，双管齐下将隐空间钉死在因果关系上。推理时所有隐 token 一步 prefill，延迟与直接出答案持平，4B 模型在四大基准全 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜DreamerV3：通过世界模型掌握多样领域——通用强化学习智能体</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/dreamerv3%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/dreamerv3%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>DreamerV3 是 DeepMind 提出的通用强化学习算法，通过学习世界模型并在想象中规划，以单一固定超参数配置在 150 多个多样化任务上超越专用算法。首次从零开始在 Minecraft 中收集钻石，标志着强化学习向通用化迈出了重要一步。</description>
    </item>
    <item>
      <title>论文精读｜Senna：用 VLM 给端到端驾驶装上&#39;大脑&#39;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/senna-vlm%E8%BE%85%E5%8A%A9%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/senna-vlm%E8%BE%85%E5%8A%A9%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</guid>
      <description>Senna 将大型视觉语言模型（Senna-VLM）与端到端规划器（Senna-E2E）解耦协同，VLM 用自然语言输出高层决策，E2E 在该决策条件下生成精确轨迹。它巧妙绕开了 LVLM 不擅长数值预测的软肋，让 VLM 干&amp;rsquo;说人话做决策&amp;rsquo;、E2E 干&amp;rsquo;算轨迹画路点&amp;rsquo;。这条 VLM 辅助端到端驾驶的路线成为后续多个工作的设计原型。</description>
    </item>
    <item>
      <title>论文精读｜UniSim：学习交互式真实世界模拟器——生成式世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/unisim%E4%BA%A4%E4%BA%92%E5%BC%8F%E4%B8%96%E7%95%8C%E6%A8%A1%E6%8B%9F%E5%99%A8%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/unisim%E4%BA%A4%E4%BA%92%E5%BC%8F%E4%B8%96%E7%95%8C%E6%A8%A1%E6%8B%9F%E5%99%A8%E7%B2%BE%E8%AF%BB/</guid>
      <description>UniSim 是由 Google DeepMind、UC Berkeley 和 MIT 联合提出的通用真实世界模拟器，通过生成式建模将互联网图像、机器人操作、人类活动等异构数据统一到一个动作输入-视频输出的框架中。该模型能够模拟从高层语言指令到低层机器人控制的各种交互，在视觉-语言规划、强化学习和视频描述等任务上实现了零样本真实世界迁移。</description>
    </item>
    <item>
      <title>论文精读｜Gen-Drive：扩散模型生成 &#43; 强化学习精调的驾驶策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/gen-drive%E6%89%A9%E6%95%A3%E5%BC%BA%E5%8C%96%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/gen-drive%E6%89%A9%E6%95%A3%E5%BC%BA%E5%8C%96%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</guid>
      <description>Gen-Drive 把自动驾驶规划从&amp;rsquo;预测-规划&amp;rsquo;重构为&amp;rsquo;生成-评估&amp;rsquo;范式：行为扩散模型生成多样未来场景，学习型场景评估器（VLM 辅助训练）打分，再用 RL 微调扩散策略向高分方向优化。它创造性地将 RLHF 奖励建模思路搬进驾驶领域，验证了学习型 reward 优于人工设计。在闭环评测中展现了生成式+强化学习融合的潜力。</description>
    </item>
    <item>
      <title>论文精读｜EmbodiedGPT：基于具身思维链的视觉-语言预训练</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/embodiedgpt%E5%85%B7%E8%BA%AB%E6%80%9D%E7%BB%B4%E9%93%BE%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/embodiedgpt%E5%85%B7%E8%BA%AB%E6%80%9D%E7%BB%B4%E9%93%BE%E7%B2%BE%E8%AF%BB/</guid>
      <description>EmbodiedGPT 是由中国科学院上海AI实验室、香港大学等机构提出的端到端多模态具身基础模型，通过创新的&amp;rsquo;具身思维链&amp;rsquo;（Embodied Chain of Thought）范式，将视觉-语言预训练与具身规划紧密结合。该模型构建了大规模EgoCOT数据集，实现了从高层规划到低层控制的闭环系统，在具身规划、控制、视频描述和视觉问答等多个任务上取得了优异性能。</description>
    </item>
    <item>
      <title>论文精读｜BEVFormer：时空 Transformer 玩转多摄像头 BEV 感知</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/bevformer%E6%84%9F%E7%9F%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/bevformer%E6%84%9F%E7%9F%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>BEVFormer 开创了基于可学习 BEV queries 的时空 Transformer 感知范式，用空间交叉注意力从多视图图像采样特征、用时间自注意力沿时序聚合信息。它纯靠多摄像头就在 nuScenes 上达到 56.9% NDS 逼近 LiDAR 基线。此后几乎所有端到端驾驶方案都沿用其 BEV query+时序融合的基本设计。</description>
    </item>
    <item>
      <title>论文精读｜VIMA：基于多模态提示的通用机器人操作——多模态大模型驱动机器人</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vima-multimodal-prompts-robot-manipulation/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vima-multimodal-prompts-robot-manipulation/</guid>
      <description>VIMA提出了一种统一的多模态提示接口，将多样化的机器人操作任务转化为序列建模问题。通过Transformer编码器-解码器架构和物体中心表示，VIMA在零样本泛化设置下任务成功率最高提升2.9倍。</description>
    </item>
    <item>
      <title>论文精读｜DriveDreamer：构建真实驾驶场景的世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivedreamer%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivedreamer%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveDreamer 是首个完全从真实驾驶数据构建的自动驾驶世界模型。它用扩散模型配合 ControlNet 机制处理 HDMap、3D 框、文本和动作等多模态结构化条件，通过两阶段训练同时实现可控驾驶视频生成与未来动作预测。作为驾驶世界模型的奠基之作，它开创了从真实场景理解到未来预测的统一范式。</description>
    </item>
    <item>
      <title>论文精读｜MOO：基于预训练视觉-语言模型的开放世界物体操作</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/moo-open-world-object-manipulation/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/moo-open-world-object-manipulation/</guid>
      <description>MOO利用预训练视觉-语言模型将自然语言指令与视觉物体定位相结合，实现了对从未见过的物体类别的零样本操作泛化，在真实机器人上达到约79%的成功率。</description>
    </item>
    <item>
      <title>论文精读｜A Survey of World Models for Autonomous Driving：自动驾驶世界模型全景综述</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2501-11260/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2501-11260/</guid>
      <description>这篇持续更新的综述为自动驾驶世界模型构建了一套三层分类法：Tier I 生成未来物理世界（Image/BEV/OG/PC 四类生成范式）、Tier II 智能体行为规划（规则与学习双轨）、Tier III 预测与规划交互。它系统梳理了自监督学习、多模态预训练、生成式数据增强等训练范式，并配套发布 WMAD 论文清单与基准。是当前入门自动驾驶世界模型最系统的地图。</description>
    </item>
    <item>
      <title>论文精读｜LeRobot：让机器人学习触手可及——HuggingFace的开源机器人学习框架</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/lerobot-open-source-robot-learning/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/lerobot-open-source-robot-learning/</guid>
      <description>LeRobot是HuggingFace推出的开源机器人学习库，覆盖从底层电机控制到大规模数据集收集、存储和流式传输的完整栈，支持多种低成本机器人平台和SOTA学习算法。截至2025年9月，社区已贡献16K+数据集和数百个预训练模型，形成了去中心化的机器人数据收集生态。</description>
    </item>
    <item>
      <title>论文精读｜SafeDiffuser：用控制障碍函数给扩散规划加上安全保证</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2306-00148/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2306-00148/</guid>
      <description>SafeDiffuser 把控制论中的控制障碍函数（CBF）改造为有限时间扩散不变性，嵌入扩散去噪的每一步，为数据驱动的扩散规划器提供可证明的安全保证。它解决了扩散概率采样可能越界、约束只能&amp;rsquo;软学&amp;rsquo;、采样即赌博三大安全隐患。在迷宫、足式机器人、机械臂操作上验证了安全性与生成质量的兼得。</description>
    </item>
    <item>
      <title>论文精读｜具身智能VLA模型综述：从视觉-语言到动作生成的技术全景</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vla-survey-2024/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vla-survey-2024/</guid>
      <description>首篇系统性综述视觉-语言-动作（VLA）模型的文章，从组件、控制策略和任务规划三个维度全面梳理了VLA模型的技术脉络，涵盖CLIP/R3M/DINOv2等视觉表征、RT-1/RT-2/OpenVLA等控制策略、SayCan/Code as Policies等任务规划方法，并深入探讨了安全、数据集、基础模型等挑战与未来方向。</description>
    </item>
    <item>
      <title>论文精读｜MVAdapt：零样本多车型适应的端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-11854/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-11854/</guid>
      <description>MVAdapt 揭示了端到端自动驾驶的&amp;rsquo;车辆域差距&amp;rsquo;：模型隐式绑定了训练车的动力学特性，换车即翻车。它用轻量物理编码器编码轴距、质量、驱动方式等物理属性，通过交叉注意力注入冻结的场景编码器，在不损失视觉泛化能力的前提下实现跨车型适应。在 58 种车型上的零样本迁移表现大幅领先 naive transfer 和 URMA 等基线。</description>
    </item>
    <item>
      <title>论文精读｜Teaching VLA Models What to See and Where to Look：DriveTeach-VLA 的视觉教学三段式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/driveteach-vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/driveteach-vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>DriveTeach-VLA 指出驾驶 VLA 的瓶颈不在语言推理而在视觉空间 grounding，核心问题不是&amp;rsquo;想不清&amp;rsquo;而是&amp;rsquo;看不对&amp;rsquo;。它提出三段式视觉教学管线——DVD 蒸馏教模型&amp;rsquo;看什么&amp;rsquo;、2D 轨迹引导提示教&amp;rsquo;往哪看&amp;rsquo;、TGP-guided GRPO 教&amp;rsquo;怎么动&amp;rsquo;——层层递进注入驾驶感知先验。在 Qwen2.5-VL 上刷新 NAVSIM 与 nuScenes 双榜单 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜具身智能：形态、动作、感知与学习的协同——全面综述</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/embodied-intelligence-synergy-2025/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/embodied-intelligence-synergy-2025/</guid>
      <description>本文从形态、动作、感知与学习四个维度的协同关系出发，系统综述了具身智能的研究进展，强调智能是大脑、身体与环境紧密耦合的产物，并提出了统一的具身智能框架。</description>
    </item>
    <item>
      <title>论文精读｜From Foundation to Application: Improving VLA Models in Practice（LingBot-VLA 2.0）</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-06403/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-06403/</guid>
      <description>蚂蚁 LingBot-VLA 2.0 在数据、动作空间、预测建模三个维度同时补课：6 万小时多本体预训练数据覆盖 9 种构型，全身自由度动作空间支持头部/腰部/底盘/灵巧手协同控制，双查询蒸馏赋予模型向前看的预测能力。Token 级稀疏 MoE 动作专家有效解耦多本体异构动力学。在 GM-100 双臂基准与长程移动操作上全面领先 π0.5。</description>
    </item>
    <item>
      <title>论文精读｜iPad: Iterative Proposal-centric End-to-End Autonomous Driving</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/ipad-end-to-end-autonomous-driving/</link>
      <pubDate>Wed, 29 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/ipad-end-to-end-autonomous-driving/</guid>
      <description>iPad提出了一种以轨迹提案为中心的端到端自动驾驶框架，通过ProFormer迭代式精炼稀疏BEV提案，替代了传统的密集BEV网格范式，在NAVSIM和Bench2Drive上达到SOTA且计算效率提高10倍以上。</description>
    </item>
    <item>
      <title>论文精读｜虚实对齐：具身智能的全面综述——从仿真到真实的迁移</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/cyber-physical-alignment-2024/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/cyber-physical-alignment-2024/</guid>
      <description>本文从虚实对齐的视角全面综述具身智能，系统分析了具身感知、具身交互、具身智能体和仿真到真实迁移四大研究方向，深入探讨了多模态大模型在虚拟和现实具身智能体中的应用。</description>
    </item>
    <item>
      <title>论文精读｜DrivoR: Driving on Registers — 基于寄存器token的高效端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/drivor-driving-on-registers/</link>
      <pubDate>Wed, 29 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/drivor-driving-on-registers/</guid>
      <description>DrivoR提出了一种极简的纯Transformer端到端自动驾驶架构，利用ViT寄存器token将多相机视觉特征压缩为紧凑场景表示，仅需~40M参数即可在NAVSIM和HUGSIM上达到SOTA。</description>
    </item>
    <item>
      <title>论文精读｜ABot-M0.5：统一的移动操作世界动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-00678/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-00678/</guid>
      <description>ABot-M0.5 用&amp;rsquo;三层对齐&amp;rsquo;策略重新设计了移动操作的世界动作模型：潜在动作模块在帧级粒度捕捉视觉状态转移，解决时间粒度粗糙导致的精细接触丢失。双层 Mixture-of-Transformers 解耦导航与操作的动作空间，dream-forcing 训练策略打通训练与推理的分布鸿沟。在长程任务和精细控制上同时达到 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜ExploreVLA：密集世界建模与探索驱动的端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02714/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02714/</guid>
      <description>VLA 模型通过行为克隆学习驾驶策略，但受限于模仿学习无法探索专家分布之外的高质量策略。ExploreVLA 提出统一的理解-生成框架：用未来 RGB + 深度图生成作为密集世界建模目标，再利用世界模型的图像预测不确定性作为内在探索奖励，通过安全门控的 GRPO 优化策略。在 NAVSIM 上达到 93.7 PDMS 和 88.8 EPDMS。</description>
    </item>
    <item>
      <title>论文精读｜Agent-driven Long-tail Simulation for Autonomous Driving：用 LLM 代理驱动自动驾驶长尾仿真</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-04331/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-04331/</guid>
      <description>本文用指令跟随 LLM 代理接管仿真器中所有交通参与者，抛弃了日志回放和规则代理的传统仿真范式。LLM 通过结构化动作接口控制每辆车的目标速度、车道与让行行为，配合 Flow-Matching 轨迹生成器实现高保真物理执行。配套的 SemanticPlan 长尾语义闭环基准暴露出 SOTA 规划器在意图性交互场景中仍频繁翻车的短板。</description>
    </item>
    <item>
      <title>论文精读｜K-Risk：知识增强的高风险驾驶场景数据集</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-07103/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-07103/</guid>
      <description>K-Risk 整合欧美中三大洲 20 个轨迹数据集，用 DRF 驱动风险筛选流水线统一抽取高风险事件。它通过 LLM 为每个事件生成三元组标注（结构化描述+异常行为通知+经闭环仿真器验证的因果风险分析），首次将高风险事件标签、语义标注和可验证决策信号三合一打包。产出 31,398 个高风险事件和 1,036 个极端近碰撞子集，为风险感知自动驾驶提供标准化评测基础。</description>
    </item>
    <item>
      <title>论文精读｜Vesta：统一的具身推理通用模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-20905/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-20905/</guid>
      <description>NVIDIA 的 Vesta 用单一 Qwen3-VL-8B 基础模型统一定位、空间推理、导航和长程规划四大具身智能能力，取代了传统的拼装专家路线。它通过统一的条件语言生成范式和简洁的多模态记忆挽具，让自注意力在历史帧与当前观察间建立长程依赖。平均超越各类别最优专家 20% 以上，真机任务成功率提升超 35%。</description>
    </item>
    <item>
      <title>论文精读｜LingBot-VLA：务实的 VLA 基础模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2601-18692/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2601-18692/</guid>
      <description>LingBot-VLA 以&amp;rsquo;务实&amp;rsquo;为核心设计哲学，用 9 种双臂构型、约 2 万小时真机数据训出一个跨平台 VLA 基础模型。它通过跨构型预训练学出与具体硬件解耦的动作策略，辅以开源高效代码库（8 卡 261 样本/秒）和 GM-100 基准。在 4 个平台 100 类任务上展现强泛化能力，将 VLA 从论文模型推向产线工具。</description>
    </item>
    <item>
      <title>CoWorld-VLA精读：多专家世界模型中的自动驾驶推理</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/coworld-vla%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/coworld-vla%E7%B2%BE%E8%AF%BB/</guid>
      <description>CoWorld-VLA 在 VLM 隐空间中构建多专家 Latent CoT 推理框架，解决了文本 CoT 丢失空间信息而隐空间缺乏可条件化信号的根本矛盾。它通过语义交互、几何结构、动态演化与轨迹意图四种专家 Token，将互补的世界知识编码为显式可用的规划条件。在 NAVSIM v1 上达到 89.8 PDMS，证明了结构化隐式推理的有效性。</description>
    </item>
    <item>
      <title>RT-2精读：VLA奠基之作——将网络知识迁移到机器人控制</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-2%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-2%E7%B2%BE%E8%AF%BB/</guid>
      <description>RT-2 由 Google DeepMind 提出，首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型，让网络知识迁移到具身控制，使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力，是 VLA 范式的奠基之作。</description>
    </item>
    <item>
      <title>VLA-World精读：统一预测想象与反思推理的视觉-语言-行动世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-09059/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-09059/</guid>
      <description>VLA-World 通过将 VLA 的推理能力与世界模型的预测想象统一在单一框架中，实现了预测-生成-反思-规划的完整闭环。它利用动作驱动的可行轨迹引导下一帧图像生成，再对自生成的未来帧进行推理以修正轨迹，在 nuScenes 的规划和生成基准上均达到 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜nuTruck：面向分布式电驱重卡的自动驾驶规划闭环基准</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-13704/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-13704/</guid>
      <description>nuTruck 是首个面向分布式电驱重卡（DET）的规划训练与闭环评测基准，填补了学习型规划器在重卡领域被忽视的安全空白。它构建三轴六轮高保真非线性动力学模型并引入侧翻风险指标 LTR 与 NRS，证明了乘用车时代的&amp;rsquo;无碰撞即安全&amp;rsquo;假设在重卡上完全失效。核心发现：规划层必须考虑动力学安全，下游控制器无法兜底。</description>
    </item>
    <item>
      <title>论文精读｜VADv2：概率规划——把驾驶决策从&#34;猜唯一答案&#34;变成&#34;算概率分布&#34;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-0959/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-0959/</guid>
      <description>VADv2 把驾驶规划从&amp;rsquo;猜唯一答案&amp;rsquo;的确定性回归改造成&amp;rsquo;算所有动作的概率分布再采样&amp;rsquo;的概率规划范式。它用规划词表离散化连续动作空间、用概率场函数建模场景与动作的关联，天然处理多模态非凸解空间。在 CARLA Town05 将 Drive Score 从 76.1 拉到 85.1，且无需任何规则后处理，被 ICLR 2026 接收。</description>
    </item>
    <item>
      <title>论文精读｜WCog-VLA：双层级世界认知，让自动驾驶从被动反应走向主动博弈</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-08375/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2607-08375/</guid>
      <description>WCog-VLA 是首个桥接语义层世界预测与生成层世界演化的 VLA 框架，将 VLA 从被动反应推向主动博弈。语义层用 agent token+Game-CoT（Stackelberg 博弈思维链）做世界预测与意图推理，生成层用对齐解耦扩散 Transformer 合成多智能体联合轨迹。在 NAVSIM 刷新 PDMS 92.9 的 SOTA，证明双层级世界认知是 VLA 进阶的关键方向。</description>
    </item>
    <item>
      <title>论文精读｜DriveTransformer：统一Transformer——告别BEV，拥抱稀疏Token并行交互</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-drivetransformer/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-drivetransformer/</guid>
      <description>DriveTransformer 彻底抛弃了 BEV 表示——不再构建稠密 BEV 特征，而是让任务 query 直接与原始传感器特征交互。三种注意力（Sensor Cross-Attention、Task Self-Attention、Temporal Cross-Attention）构成统一框架，支持单阶段端到端训练。在 Bench2Drive 闭环评测中以 63.46 Driving Score 大幅超越 UniAD（45.81）和 VAD（42.35），且在鲁棒性上碾压 BEV 方案。获 ICLR 2025 接收。</description>
    </item>
    <item>
      <title>论文精读｜TransFuser：用 Transformer 做传感器融合——让相机和激光雷达&#34;商量着开车&#34;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-transfuser/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-transfuser/</guid>
      <description>TransFuser 在 CARLA 上首次验证了 Transformer 做多模态传感器融合的可行性——用自注意力让图像和 LiDAR 特征在多个分辨率上密集交互，取代简单的几何融合。在 CARLA Leaderboard 和 Longest6 基准上以显著优势领先此前所有方法，将碰撞率降低 48%。</description>
    </item>
    <item>
      <title>论文精读｜Diffusion Policy：扩散模型做机器人动作生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-policy%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-policy%E7%B2%BE%E8%AF%BB/</guid>
      <description>Diffusion Policy 将机器人动作生成重新定义为条件去噪过程，让策略网络从噪声中逐步雕刻出动作序列。它天然支持多模态动作分布与高维动作空间，解决了传统行为克隆的 mode averaging 和复合误差问题。经 CNN 和 Transformer 双架构验证，成为后续 π0、Qwen-VLA 等 VLA 模型动作头设计的奠基之作。</description>
    </item>
    <item>
      <title>论文精读｜World4Drive：用意图感知的物理隐世界模型，摆脱感知标注做端到端规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2507-00603/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2507-00603/</guid>
      <description>World4Drive 是首个将多模态驾驶意图与物理隐世界模型结合的端到端框架，无需 3D 框/高精地图等昂贵感知标注。它借 Grounded-SAM 的语义先验和 Metric3D 的深度先验构建&amp;rsquo;懂物理&amp;rsquo;的隐空间，让模型在多种驾驶意图下想象未来、用世界模型打分选最优轨迹。L2 误差降 18.1%、碰撞率降 46.7%、收敛快 3.75 倍，被 ICCV 2025 收录。</description>
    </item>
    <item>
      <title>论文精读｜PARA-Drive：完全并行的端到端架构，把感知预测规划&#34;同时跑&#34;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-para-drive/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-para-drive/</guid>
      <description>PARA-Drive 系统性地探索了端到端模块化自动驾驶的设计空间，提出完全并行的架构——感知、预测、规划模块同时训练、同时推理，互不依赖。在 nuScenes 上 L2 误差降低 28.8%、碰撞率降低 43.3%，推理速度提升近 3 倍，被 CVPR 2024 接收。</description>
    </item>
    <item>
      <title>论文精读｜VLA for Autonomous Driving：自动驾驶视觉-语言-动作模型的过去、现在与未来</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2512-16760/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2512-16760/</guid>
      <description>这份 47 页的综述首次为自动驾驶 VLA 建立了系统形式化与分类法，从 VA（视觉-动作）到 VLA（视觉-语言-动作）理清演进线。它提出端到端 VLA 与双系统 VLA 两大范式分类，并统一梳理了动作空间四分法、数据集基准与评测协议。是当前自动驾驶 VLA 领域最权威的架构脉络地图和未来挑战指南。</description>
    </item>
    <item>
      <title>论文精读｜TruckV2X：首个以重卡为中心的 V2X 车路协同感知数据集，专治盲区与挂车遮挡</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-truckv2x/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-truckv2x/</guid>
      <description>TruckV2X (IEEE RA-L 2025) 是首个以半挂重卡为中心的 V2X 多模态多智能体协同感知数据集，用 CARLA 仿真构建 64 个场景、88,396 帧点云、百万图像、118 万 3D 框，覆盖牵引车-挂车-CAV-RSU 四类智能体，系统性揭示重卡因车身长、挂车摆动、转弯内侧盲区而对车路协同的刚需。</description>
    </item>
    <item>
      <title>论文精读：DiffusionDriveV2 — RL-Constrained Truncated Diffusion</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2512-07745/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2512-07745/</guid>
      <description>DiffusionDriveV2 将强化学习引入截断扩散模型，提出 Intra-Anchor GRPO 和 Inter-Anchor Truncated GRPO，解决了 DiffusionDrive 中多样性与一致高质量之间的根本矛盾。在 NAVSIM v1 上达到 91.2 PDMS，v2 上达到 85.5 EPDMS，均创下新纪录。</description>
    </item>
    <item>
      <title>论文精读｜ACT &#43; ALOHA：低成本双臂遥操作与动作分块策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/act-aloha%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/act-aloha%E7%B2%BE%E8%AF%BB/</guid>
      <description>ACT+ALOHA 用不到 2 万美元的开源双臂遥操作平台解决了精细双臂操控的数据获取难题。ACT 采用动作分块（Action Chunking）+CVAE Transformer 的抗复合误差策略，将模仿学习精度推至新高度。ALOHA 的低成本同构主从机械臂设计为具身智能数据采集建立了新范式。</description>
    </item>
    <item>
      <title>论文精读：Longitudinal Safety Distance Control Considering Cargo Load（ICVES 2025）——RSS 安全距离模型为什么漏算了满载重卡的刹车</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-cargoload-rss/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-cargoload-rss/</guid>
      <description>ICVES 2025 论文 Longitudinal Safety Distance Control Considering Cargo Load for Autonomous Heavy-Duty Vehicles 指出经典 RSS 安全距离模型假设车辆质量恒定，忽略了货物载荷，导致满载重卡制动距离更长、RSS 给出的安全距离不足而撞车。本文从 RSS 公式出发，讲清质量/载荷如何修正制动距离，并呼应博客 nuTruck 一文：现有 benchmark 不把质量/动力学安全作为指标。</description>
    </item>
    <item>
      <title>RiskWorld 论文精读：以目标为中心的潜在世界模型，用于自动驾驶风险识别</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/riskworld%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/riskworld%E7%B2%BE%E8%AF%BB/</guid>
      <description>北航 × 中关村实验室 RiskWorld 精读：不用「全局想象未来帧」，而是为每个周围目标单独跑一遍「如果它继续运动会怎样」的 RSSM 潜在动力学推演，从中解码出目标级风险评分。RiskBench 上 F1=63.0%、误报率仅 2.1%，在「谁是风险源」这个精准定位问题上超过了所有基线。</description>
    </item>
    <item>
      <title>论文精读｜TransDiffuser：去相关多模态表示驱动的扩散式轨迹生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2505-09315-transdiffuser/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2505-09315-transdiffuser/</guid>
      <description>LiAuto 提出 TransDiffuser，用多模态表示去相关（Decorrelation）解决扩散轨迹生成中的模式坍缩问题。核心思路是强制多模态条件特征的维度去相关，让条件信号更丰富地覆盖潜空间，从而无需任何锚点轨迹或场景先验即可生成多样化轨迹。ResNet-34 + LiDAR 配置在 NAVSIM 上达到 PDMS 94.85。本文将用一张图一张图对应讲解的方式，把这篇论文的动机、架构、核心创新全部讲清楚。</description>
    </item>
    <item>
      <title>论文精读：Drive-JEPA — Video JEPA 预训练 &#43; 多模态轨迹蒸馏的端到端驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2601-22032/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2601-22032/</guid>
      <description>Drive-JEPA（2026）指出端到端驾驶的两个瓶颈：(1) 视频世界模型预训练收益有限；(2) 每场景只有一条人类轨迹，多模态监督稀缺。它用 V-JEPA（而非生成式世界模型）在 208 小时驾驶视频上自监督预训练 ViT 编码器，得到规划对齐的表征；再用基于仿真器的「多模态轨迹蒸馏」把多样伪教师轨迹蒸馏进 proposal-centric 规划器，并以动量感知选择抑制帧间抖动。NAVISIM v1 达 93.3 PDMS、v2 达 87.8 EPDMS 双榜 SOTA，仅前视相机+轻量 transformer 即在无感知设定下超此前 SOTA 3 PDMS。</description>
    </item>
    <item>
      <title>论文精读：GTRS — 通用轨迹评分（CVPR25 自动驾驶挑战赛冠军）</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-06664/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-06664/</guid>
      <description>GTRS（NVIDIA, CVPR 2025 自动驾驶挑战赛 E2E 赛道冠军）指出：现有轨迹评分器要么打「静态大词表」要么打「动态小候选」，两者都泛化差。GTRS 用三根支柱统一二者：(1) 扩散策略生成细粒度动态候选；(2) 在 16384 的超密集词表上训练评分器 + 词表 dropout，使推理时能在更小子集上强泛化；(3) 传感器旋转增强 + top-k 细化自蒸馏，提升域外鲁棒性。Navhard 榜 EPDMS 最高 49.4，逼近依赖真值感知的 PDM-Closed。</description>
    </item>
    <item>
      <title>论文精读：WoTE — 用 BEV 世界模型做在线轨迹评估的端到端驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2504-01941/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2504-01941/</guid>
      <description>WoTE（ICCV 2025, CASIA）指出：端到端规划器只生成轨迹却「盲目」选轨迹，缺少对未来后果的预判。它用一个 BEV 空间世界模型，给每条候选轨迹 rollout 出未来 BEV 状态，再由奖励模型打分挑最高奖励者。BEV 空间比图像级世界模型省算力，且能直接用 nuPlan 等 BEV 仿真器提供监督。NAVISIM 达 88.3 PDMS，Bench2Drive 闭环 Driving Score 61.71 创 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜Anti-rollover APF — 用五自由度动力学 &#43; 侧翻排斥势场，让重卡规划阶段就避开翻车</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-antirollover-apf/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-antirollover-apf/</guid>
      <description>本文精读 Jin 与 He 在 2024 年 Chinese Journal of Mechanical Engineering 发表的 Anti-rollover Artificial Potential Field Motion Planning Method of an Autonomous Heavy Truck Optimised by Game Theory。论文用 5-DOF 重卡动力学模型推导侧翻指标，提出把侧翻排斥势场（anti-rollover APF）融入 MPC 运动规划，并用博弈论优化势场权重，让重卡在规划阶段就同时兼顾避障与防侧翻。面向刚入行的 VLA 工程师，用大白话讲清侧翻机理、LTR 判据、五自由度模型与势场规划框架，并呼应博客 nuTruck 文章。</description>
    </item>
    <item>
      <title>论文精读｜TruckDrive — 面向重卡的长距离高速公路感知数据集，把感知边界推到 1000 米</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-truckdrive/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-truckdrive/</guid>
      <description>TruckDrive 是 Torc Robotics 与普林斯顿大学在 CVPR 2026 提出的面向半挂重卡的高速公路长距离多模态感知数据集，含 47.5 万同步样本、16.5 万密集标注帧，2D 标注延伸到 1000 米、3D 标注延伸到 400 米，配备了 7 台长距 FMCW 激光雷达、10 台 4D 雷达与 11-15 路多焦距相机。本文用大白话拆解其传感器架构（含完整的传感器位置坐标表）、标注流水线、与 nuScenes/ONCE 等数据集的定量对比，并深入分析重卡制动距离公式、高速场景对感知的独特要求（300-500 米安全感知窗口），以及当前 VLA 模型在 150 米处系统性失效的原因。文章还包含感知距离需求对比图、TruckDrive 车辆传感器部署实拍、以及范围分布图等多个可视化素材。</description>
    </item>
    <item>
      <title>论文精读：FeaXDrive — Feasibility-aware Trajectory-Centric Diffusion Planning</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-12656/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-12656/</guid>
      <description>FeaXDrive 发现噪声中心扩散规划与轨迹可行性空间存在根本错位，提出轨迹中心扩散框架，通过自适应曲率正则化训练、可行驶区域引导推理和可行性感知 GRPO 后训练系统提升轨迹物理可行性。在 NAVSIM 上达 88.7 PDMS (IL) / 90.0 PDMS (RL)，曲率违反率从 8.59% 降至 0.88%。</description>
    </item>
    <item>
      <title>论文精读：Hydra-MDP — End-to-end Multimodal Planning with Multi-target Hydra-Distillation</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2406-06978/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2406-06978/</guid>
      <description>Hydra-MDP 提出多教师知识蒸馏框架，从人类示范教师（模仿人类轨迹）和规则教师（碰撞/可行驶区域等闭环指标）中同时学习，用多头解码器集成多样化轨迹候选。它以端到端可微分的方式统一了模仿学习和闭环指标优化，在 CVPR 2024 Navsim 挑战赛获得第一名，证明了多目标蒸馏范式在驾驶规划中的有效性。</description>
    </item>
    <item>
      <title>论文精读：UniDriveVLA — Mixture-of-Transformers 解耦感知-推理冲突的统一驾驶 VLA</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02190/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02190/</guid>
      <description>UniDriveVLA 提出 Mixture-of-Transformers 架构，通过理解/感知/规划三个专家解耦感知-推理冲突，结合 Masked Joint Attention 与稀疏感知范式，在 nuScenes 开环和 Bench2Drive 闭环上均达到 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜AutoDrive-P³：感知-预测-规划链式思维的统一强化微调——ICLR 2026 端到端驾驶新范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-28116/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-28116/</guid>
      <description>当前 VLM 驾驶方案要么直接输出规划缺失 CoT 推理，要么将感知-预测-规划割裂为独立模块缺乏协同。AutoDrive-P³ 提出统一链式思维框架，通过 P³-CoT 数据集构建感知→预测→规划的结构化推理链，再用 P³-GRPO 算法进行分层渐进式强化微调——将奖励从规划反传到感知和预测模块，实现三模块联合优化。在 NAVSIM 上达到 89.9 EPDMS，nuScenes 上取得最低碰撞率。</description>
    </item>
    <item>
      <title>论文精读｜DriveFuture：未来感知潜在世界模型——以未来状态条件化当前规划的 SOTA 范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-09701/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-09701/</guid>
      <description>现有潜在世界模型将未来状态视为预测目标而非规划条件，导致当前与未来特征纠缠。DriveFuture 提出以未来世界状态显式条件化当前决策的框架：训练时用 GT 未来潜在状态做条件，推理时用预测的未来状态接替，实现统一的规划导向 foresight 机制。在 NAVSIM v2 navhard 上以 55.5 EPDMS 排名第一，navtest 上达到 89.9 EPDMS 和 90.7 PDMS。</description>
    </item>
    <item>
      <title>论文精读｜Uni-World VLA — 交错世界建模与规划实现闭环交互驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-27287/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-27287/</guid>
      <description>现有世界模型通常先生成完整未来视频再规划（开环想象），但这种方式忽略了规划决策对环境的实时反馈。Uni-World VLA 提出交错生成范式——模型逐帧交替预测未来画面和自车动作，形成世界建模与控制的闭环交互。同时引入单目深度图作为几何线索增强空间感知。在 NAVSIM 上以单目 RGB 达到 89.4 PDMS，超越多传感器融合方法。</description>
    </item>
    <item>
      <title>论文精读：Bench2Drive — Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2406-03877/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2406-03877/</guid>
      <description>现有端到端自动驾驶评测存在开环指标不可靠、长路线闭环方差大、缺乏统一训练集三大问题。Bench2Drive 由上海交通大学提出，是首个面向多维度驾驶能力的闭环评测基准，提供 200 万帧统一标注训练数据与 220 条短路线多技能评估协议。实验表明开环 L2 误差与闭环驾驶分数相关性极弱（Pearson r=0.03），专家特征蒸馏与细粒度能力评估是提升端到端自动驾驶的关键方向。</description>
    </item>
    <item>
      <title>论文精读：BEV-VAE — Multi-View Image Generation with Spatial Consistency</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2507-00707/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2507-00707/</guid>
      <description>现有自动驾驶多视角生成方法缺乏显式3D建模，仅将问题视为2D图像集合成。BEV-VAE提出在BEV隐空间中进行编码与生成，通过多视角VAE构造统一BEV表征，再以DiT进行潜扩散生成。在nuScenes和Argoverse 2上，BEV-VAE实现了高保真重建与3D一致的多视角生成，并支持新视角合成与3D布局可控生成。</description>
    </item>
    <item>
      <title>论文精读：TOAD — Test-Time Trajectory Optimization for Autonomous Driving</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-07170/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-07170/</guid>
      <description>端到端自动驾驶规划器通常先生成候选轨迹再评分，但评分器无法影响候选集本身，弱候选集会限制性能。TOAD将评分器重新定义为学习到的轨迹级奖励函数，在测试时使用交叉熵方法（CEM）搜索最大化该奖励的轨迹，无需重训练即可即插即用。在NAVSIM-v1（94.7 PDMS）、NAVSIM-v2（56.3 EPDMS）和闭环HUGSIM基准上，TOAD一致提升了六种基规划器的表现，并深入分析了评分器泛化能力对测试时搜索的关键影响。</description>
    </item>
    <item>
      <title>论文精读：WorldVLA — Towards Autoregressive Action World Model</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-21539/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-21539/</guid>
      <description>WorldVLA 提出统一的自回归动作世界模型，将VLA与世界模型融合在单一LLM框架中。通过三种模态的离散token共享词汇表实现图像/文本/动作的全统一，并提出动作注意力掩码解决长序列动作块的误差累积问题。在LIBERO基准上动作成功率提升4%、FVD降低10%，证实世界模型与动作模型的双向增强。</description>
    </item>
    <item>
      <title>论文精读｜CLOVER：闭环价值估计与排序框架——端到端自动驾驶规划的生成-打分新范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-15120/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-15120/</guid>
      <description>端到端自动驾驶规划器的训练（模仿单条轨迹）与评测（规则化指标）存在根本性错配。CLOVER 提出轻量级生成器-打分器架构，通过构造评估器过滤的伪专家轨迹实现集合级覆盖训练，再以保守闭环自蒸馏交替优化生成器与打分器。在 NAVSIM 上达到 94.5 PDMS 和 90.4 EPDMS，刷新 SOTA，并提供了不完备打分器仍能提升生成器的理论保证。</description>
    </item>
    <item>
      <title>论文精读｜ReWorld — 面向 World Action Model 的表征学习</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-27504/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-27504/</guid>
      <description>现有 World Action Model 仅通过输出端损失间接塑造中间表征，导致世界知识无法有效传递到规划模块。ReWorld 首次提出面向自动驾驶 WAM 的表征学习框架，通过未来预测监督、跨模态对齐和硬负样本排斥三个维度直接优化中间表征，在 nuScenes 上将 FVD 从 81.3 降至 61.9（降幅 23.9%），在 NAVSIM 上将闭环 PDMS 从 89.1 提升至 90.4 且无需 RL 后训练。</description>
    </item>
    <item>
      <title>论文精读｜X-World — 可控多相机世界模型实现可扩展端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-19979/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-19979/</guid>
      <description>端到端自动驾驶面临评测成本高、场景覆盖有限、难以复现的瓶颈。X-World 提出了一种以自我为中心的多视角生成式世界模型，通过动作条件化的多相机视频生成实现可控闭环仿真，在动作跟随度、跨视角一致性和长时序稳定性上取得了突破性表现。论文详细设计了两阶段级联训练策略、视角-时序自注意力机制和异构条件注入方案，为 VLA 系统的可扩展闭环评测与仿真训练提供了完整基础设施。</description>
    </item>
  </channel>
</rss>
