<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>🏭 Google on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/tags/-google/</link>
    <description>Recent content in 🏭 Google on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Tue, 28 Jul 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/tags/-google/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>论文精读｜PaLM-E：具身多模态语言模型——让机器人理解真实世界</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/palm-e%E5%85%B7%E8%BA%AB%E5%A4%9A%E6%A8%A1%E6%80%81%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/palm-e%E5%85%B7%E8%BA%AB%E5%A4%9A%E6%A8%A1%E6%80%81%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>PaLM-E是Google与柏林工业大学联合提出的具身多模态语言模型，将PaLM大语言模型与视觉编码器结合，直接处理机器人传感器数据。该模型在562B参数规模下不仅在机器人任务上表现出色，还在OK-VQA等视觉语言基准上达到SOTA，同时保留了强大的语言能力。</description>
    </item>
    <item>
      <title>论文精读｜SayCan：让大型语言模型在机器人上落地执行</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/saycan%E8%AF%AD%E8%A8%80-grounding%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/saycan%E8%AF%AD%E8%A8%80-grounding%E7%B2%BE%E8%AF%BB/</guid>
      <description>SayCan是Google提出的将大型语言模型与机器人技能结合的方法，通过将LLM的语言知识与机器人技能的可行性（affordance）结合，实现了自然语言指令到长horizon机器人任务的规划与执行。该工作首次展示了LLM如何在真实机器人上落地，开启了LLM+机器人的新范式。</description>
    </item>
    <item>
      <title>论文精读｜Open X-Embodiment：跨机器人大规模数据集与RT-X模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/open-x-embodiment%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/open-x-embodiment%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>Open X-Embodiment是Google联合21家机构打造的跨机器人大规模数据集，包含22种机器人、100万+轨迹数据。基于该数据集训练的RT-X模型首次证明了跨机器人正迁移的可行性，RT-1-X成功率提升50%，RT-2-X泛化能力提升3倍。</description>
    </item>
    <item>
      <title>论文精读｜DROID：大规模真实世界机器人操作数据集</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/droid%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%93%8D%E4%BD%9C%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/droid%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%93%8D%E4%BD%9C%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>DROID是Google联合18家机构打造的大规模真实世界机器人操作数据集，包含76k演示轨迹、564个场景、86个任务，跨越北美、亚洲、欧洲三大洲。实验证明使用DROID训练的策略在性能和泛化能力上平均提升20%。</description>
    </item>
    <item>
      <title>论文精读｜UniSim：学习交互式真实世界模拟器——生成式世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/unisim%E4%BA%A4%E4%BA%92%E5%BC%8F%E4%B8%96%E7%95%8C%E6%A8%A1%E6%8B%9F%E5%99%A8%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/unisim%E4%BA%A4%E4%BA%92%E5%BC%8F%E4%B8%96%E7%95%8C%E6%A8%A1%E6%8B%9F%E5%99%A8%E7%B2%BE%E8%AF%BB/</guid>
      <description>UniSim 是由 Google DeepMind、UC Berkeley 和 MIT 联合提出的通用真实世界模拟器，通过生成式建模将互联网图像、机器人操作、人类活动等异构数据统一到一个动作输入-视频输出的框架中。该模型能够模拟从高层语言指令到低层机器人控制的各种交互，在视觉-语言规划、强化学习和视频描述等任务上实现了零样本真实世界迁移。</description>
    </item>
    <item>
      <title>RT-2精读：VLA奠基之作——将网络知识迁移到机器人控制</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-2%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-2%E7%B2%BE%E8%AF%BB/</guid>
      <description>RT-2 由 Google DeepMind 提出，首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型，让网络知识迁移到具身控制，使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力，是 VLA 范式的奠基之作。</description>
    </item>
  </channel>
</rss>
