<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>世界模型 on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/tags/%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B/</link>
    <description>Recent content in 世界模型 on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Mon, 10 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/tags/%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>论文精读｜ExploreVLA：密集世界建模与探索驱动的端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02714/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02714/</guid>
      <description>VLA 模型通过行为克隆学习驾驶策略，但受限于模仿学习无法探索专家分布之外的高质量策略。ExploreVLA 提出统一的理解-生成框架：用未来 RGB + 深度图生成作为密集世界建模目标，再利用世界模型的图像预测不确定性作为内在探索奖励，通过安全门控的 GRPO 优化策略。在 NAVSIM 上达到 93.7 PDMS 和 88.8 EPDMS。</description>
    </item>
    <item>
      <title>端到端自动驾驶模型架构全解：从感知到规划的六大范式与 80&#43; 模型逐篇拆解</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-model-architecture-synthesis/</link>
      <pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-model-architecture-synthesis/</guid>
      <description>把博客全部自动驾驶模型精读收进同一坐标系：显式端到端 / Scoring / 扩散与Flow / VLA / 世界模型 / 数据评测基建六大范式，80&#43; 模型逐篇给出感知表征、架构组成、训练方式与 PDMS/EPDMS 分数，最后给出我对端到端演进方向的个人思考。</description>
    </item>
    <item>
      <title>纯视觉端到端模型在 Cosmos 风格迁移加持下的 NAVSIM 大规模评测：11 个开源模型全景</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/e2e-navsim-models-cosmos-style/</link>
      <pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/e2e-navsim-models-cosmos-style/</guid>
      <description>课题组新 benchmark：用 Cosmos 做雨/雪/晴风格迁移构建 NAVSIM 视觉压力测试，批量评测 11 个纯视觉（camera-only）端到端规划模型。本文系统梳理 SparseDriveV2、iPad、DrivoR、ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0、Drive-JEPA、DriveSuprim、DriveLaW、LTF 的论文架构（附 arXiv 原文架构图）、开源资源、评测配置与 NAVSIM PDMS/EPDMS 成绩。</description>
    </item>
    <item>
      <title>Cosmos 3 代码讲解：Mixture-of-Transformers 双塔统一五模态世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/cosmos3%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Wed, 29 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/cosmos3%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>拆解 NVIDIA/cosmos-framework：MoT 双塔架构让 Reasoner（自回归语义理解）和 Generator（扩散生成）共享每一层 Transformer 权重但各有独立投影；DCAE 对视频做 4×32×32 极致压缩；Rectified Flow 做生成训练；序列打包（sequence packing）把 und/gen token 拼成一条序列走一次前向</description>
    </item>
    <item>
      <title>思考｜重卡 VLA 是一个巨大的研究空白——兼论 Truck-VLA 架构设计</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/%E9%87%8D%E5%8D%A1vla%E7%A0%94%E7%A9%B6%E7%A9%BA%E7%99%BD%E4%B8%8E%E5%89%8D%E7%9E%BB/</link>
      <pubDate>Thu, 23 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/%E9%87%8D%E5%8D%A1vla%E7%A0%94%E7%A9%B6%E7%A9%BA%E7%99%BD%E4%B8%8E%E5%89%8D%E7%9E%BB/</guid>
      <description>2024-2026 年自动驾驶 VLA 论文爆发（100&#43; 篇），但全部聚焦乘用车。重卡场景的 VLA 模型——能理解语言指令、感知场景、输出安全轨迹的端到端系统——迄今零论文。本文系统分析了这个空白的成因，并提出了完整的 Truck-VLA 架构设计方案。</description>
    </item>
    <item>
      <title>nuTruck 重卡安全驾驶策略研究</title>
      <link>https://auto-driving-blog.pages.dev/posts/projects/nutruck/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/projects/nutruck/</guid>
      <description>面向重卡场景的安全驾驶策略研究，关注侧翻与载荷滑移风险评估及动力学约束下的轨迹生成。</description>
    </item>
    <item>
      <title>代码讲解：DriveVLA-W0 世界模型如何给 VLA 大模型补上稠密监督</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/drivevla-w0%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/drivevla-w0%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>逐行拆解 BraveGroup/DriveVLA-W0 的已开源代码，面向零基础读者：先讲清 VLA、世界模型、MoE、Flow Matching、FAST tokenizer 等黑话，再厘清仓库边界（只开源了 policy_head 与 tokenizer，VLM 主干在外部库），然后逐文件拆解 MoE 动作专家、Flow Matching 解码器、扩散策略头、动作 tokenizer 与世界模型 VQ 编码器，最后把一次前向从图像到轨迹串成 7 步、讲透两阶段训练与推理旁路世界模型的设计。一篇把代码边界到数据流到关键模块到训练梯度到推理选轨迹到个人思考全部讲明白的极详细工程向代码讲解。</description>
    </item>
    <item>
      <title>论文精读：WoTE — 用 BEV 世界模型做在线轨迹评估的端到端驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2504-01941/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2504-01941/</guid>
      <description>WoTE（ICCV 2025, CASIA）指出：端到端规划器只生成轨迹却「盲目」选轨迹，缺少对未来后果的预判。它用一个 BEV 空间世界模型，给每条候选轨迹 rollout 出未来 BEV 状态，再由奖励模型打分挑最高奖励者。BEV 空间比图像级世界模型省算力，且能直接用 nuPlan 等 BEV 仿真器提供监督。NAVISIM 达 88.3 PDMS，Bench2Drive 闭环 Driving Score 61.71 创 SOTA。</description>
    </item>
    <item>
      <title>论文精读｜DriveFuture：未来感知潜在世界模型——以未来状态条件化当前规划的 SOTA 范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-09701/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2605-09701/</guid>
      <description>现有潜在世界模型将未来状态视为预测目标而非规划条件，导致当前与未来特征纠缠。DriveFuture 提出以未来世界状态显式条件化当前决策的框架：训练时用 GT 未来潜在状态做条件，推理时用预测的未来状态接替，实现统一的规划导向 foresight 机制。在 NAVSIM v2 navhard 上以 55.5 EPDMS 排名第一，navtest 上达到 89.9 EPDMS 和 90.7 PDMS。</description>
    </item>
    <item>
      <title>论文精读｜Uni-World VLA — 交错世界建模与规划实现闭环交互驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-27287/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-27287/</guid>
      <description>现有世界模型通常先生成完整未来视频再规划（开环想象），但这种方式忽略了规划决策对环境的实时反馈。Uni-World VLA 提出交错生成范式——模型逐帧交替预测未来画面和自车动作，形成世界建模与控制的闭环交互。同时引入单目深度图作为几何线索增强空间感知。在 NAVSIM 上以单目 RGB 达到 89.4 PDMS，超越多传感器融合方法。</description>
    </item>
    <item>
      <title>论文精读：WorldVLA — Towards Autoregressive Action World Model</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-21539/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2506-21539/</guid>
      <description>WorldVLA 提出统一的自回归动作世界模型，将VLA与世界模型融合在单一LLM框架中。通过三种模态的离散token共享词汇表实现图像/文本/动作的全统一，并提出动作注意力掩码解决长序列动作块的误差累积问题。在LIBERO基准上动作成功率提升4%、FVD降低10%，证实世界模型与动作模型的双向增强。</description>
    </item>
    <item>
      <title>论文精读｜ReWorld — 面向 World Action Model 的表征学习</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-27504/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2606-27504/</guid>
      <description>现有 World Action Model 仅通过输出端损失间接塑造中间表征，导致世界知识无法有效传递到规划模块。ReWorld 首次提出面向自动驾驶 WAM 的表征学习框架，通过未来预测监督、跨模态对齐和硬负样本排斥三个维度直接优化中间表征，在 nuScenes 上将 FVD 从 81.3 降至 61.9（降幅 23.9%），在 NAVSIM 上将闭环 PDMS 从 89.1 提升至 90.4 且无需 RL 后训练。</description>
    </item>
    <item>
      <title>论文精读｜X-World — 可控多相机世界模型实现可扩展端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-19979/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-19979/</guid>
      <description>端到端自动驾驶面临评测成本高、场景覆盖有限、难以复现的瓶颈。X-World 提出了一种以自我为中心的多视角生成式世界模型，通过动作条件化的多相机视频生成实现可控闭环仿真，在动作跟随度、跨视角一致性和长时序稳定性上取得了突破性表现。论文详细设计了两阶段级联训练策略、视角-时序自注意力机制和异构条件注入方案，为 VLA 系统的可扩展闭环评测与仿真训练提供了完整基础设施。</description>
    </item>
  </channel>
</rss>
