<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>🔀 多模态融合 on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/tags/-%E5%A4%9A%E6%A8%A1%E6%80%81%E8%9E%8D%E5%90%88/</link>
    <description>Recent content in 🔀 多模态融合 on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Wed, 19 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/tags/-%E5%A4%9A%E6%A8%A1%E6%80%81%E8%9E%8D%E5%90%88/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>论文精读｜Percept-WAM：把 2D/3D 感知&#39;种&#39;进 VLM 里的感知增强世界动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/percept-wam%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/percept-wam%E7%B2%BE%E8%AF%BB/</guid>
      <description>Percept-WAM 回答的是 WAM 系列的另一个致命问题：VLM 的空间感太差——&amp;lsquo;定位漂移、时序不一致、置信度虚高&amp;rsquo;，导致 VLA 系统的感知和规划都不稳。它把 2D/3D 感知任务直接&amp;rsquo;种&amp;rsquo;进单个 VLM 里：用 World-PV token（透视视角）和 World-BEV token（鸟瞰视角）编码可定位的世界状态，配合网格条件化预测头、IoU 校准置信度和并行自回归解码，再用四组点级 query（Q_pv/Q_bev/Q_ego/Q_full）把感知表示对齐成轨迹。NAVSIM v1 拿到 90.2 PDMS，超过 DiffusionDrive 2.1，还配了流式推理把时延压到 707ms。</description>
    </item>
    <item>
      <title>论文精读｜BrainWAM：大脑式&#39;动作空间协调&#39;——把 VLA 语义先验和 WAM 预测动态拧成一股绳</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/brainwam%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/brainwam%E7%B2%BE%E8%AF%BB/</guid>
      <description>BrainWAM 用&amp;rsquo;大脑分工&amp;rsquo;的思路回答一个根本问题：VLA（语义推理）和 WAM（预测动态）到底该怎么结合？它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号；再受左右脑半球经胼胝体通信、小脑协调运动意图的启发，把语义和预测拆成两条特化通路，各自产出&amp;rsquo;面向动作&amp;rsquo;的表示，最后在紧凑的动作空间里用 CAB（胼胝体动作桥）双向交换、CIF（小脑意图融合）协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS，双双超过 VLA-only、WAM-only 和 Tri-MoT。</description>
    </item>
  </channel>
</rss>
