<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>🤖 具身导航 on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/tags/-%E5%85%B7%E8%BA%AB%E5%AF%BC%E8%88%AA/</link>
    <description>Recent content in 🤖 具身导航 on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Mon, 17 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/tags/-%E5%85%B7%E8%BA%AB%E5%AF%BC%E8%88%AA/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>论文精读｜Metis：用&#39;非对称注意力掩码&#39;把视频生成与动作预测解耦的世界动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/metis%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/metis%E7%B2%BE%E8%AF%BB/</guid>
      <description>Metis 用 Mixture-of-Transformers 把&amp;rsquo;视频生成专家&amp;rsquo;和&amp;rsquo;动作预测专家&amp;rsquo;拆成两个独立 Transformer，再用一张非对称注意力掩码管理二者的信息流：动作只看向当前帧，未来视频可以看动作。训练时联合优化两者学到世界动态，推理时直接跳过视频生成只跑动作分支——NAVSIM-v2 navhard/navtest 和 CityWalker 全面 SOTA，纯动作推理比带视频快 8 倍，还零样本部署到四足机器人。</description>
    </item>
  </channel>
</rss>
