<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>具身智能 on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/categories/%E5%85%B7%E8%BA%AB%E6%99%BA%E8%83%BD/</link>
    <description>Recent content in 具身智能 on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Tue, 28 Jul 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/categories/%E5%85%B7%E8%BA%AB%E6%99%BA%E8%83%BD/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>论文精读｜π0：基于Flow Matching的通用视觉-语言-动作模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/pi0-%E9%80%9A%E7%94%A8vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/pi0-%E9%80%9A%E7%94%A8vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>π0 用预训练 VLM 做大脑、Flow Matching 做动作头，开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单，相比离散化精度更高，巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练，一个模型搞定从叠衣服到收桌子的多种高难度操作。</description>
    </item>
    <item>
      <title>论文精读｜LIBERO：面向终身机器人学习的知识迁移基准</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/libero%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/libero%E7%B2%BE%E8%AF%BB/</guid>
      <description>LIBERO 是首个面向终身决策学习（LLDM）的机器人操作基准，包含 130 个语言条件任务和 4 个任务套件。它系统研究了五种知识迁移场景下的策略架构、终身学习算法、任务顺序、预训练效果等关键问题。一个反直觉的发现：简单的顺序微调在正向迁移上反而优于 EWC、ER 等经典终身学习方法。</description>
    </item>
    <item>
      <title>论文精读｜RT-1：Robotics Transformer——大规模真实机器人数据驱动的策略学习</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-1-robotics-transformer%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-1-robotics-transformer%E7%B2%BE%E8%AF%BB/</guid>
      <description>RT-1是Google Robotics团队提出的一种基于Transformer的机器人策略模型，通过在超过13万条真实机器人轨迹数据上训练，实现了对700+种任务的强大泛化能力。该工作首次证明了大规模、多样化的真实数据结合高容量架构能够在机器人领域取得类似NLP和CV领域的scalable性能。</description>
    </item>
    <item>
      <title>论文精读｜PaLM-E：具身多模态语言模型——让机器人理解真实世界</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/palm-e%E5%85%B7%E8%BA%AB%E5%A4%9A%E6%A8%A1%E6%80%81%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/palm-e%E5%85%B7%E8%BA%AB%E5%A4%9A%E6%A8%A1%E6%80%81%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>PaLM-E是Google与柏林工业大学联合提出的具身多模态语言模型，将PaLM大语言模型与视觉编码器结合，直接处理机器人传感器数据。该模型在562B参数规模下不仅在机器人任务上表现出色，还在OK-VQA等视觉语言基准上达到SOTA，同时保留了强大的语言能力。</description>
    </item>
    <item>
      <title>论文精读｜SayCan：让大型语言模型在机器人上落地执行</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/saycan%E8%AF%AD%E8%A8%80-grounding%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/saycan%E8%AF%AD%E8%A8%80-grounding%E7%B2%BE%E8%AF%BB/</guid>
      <description>SayCan是Google提出的将大型语言模型与机器人技能结合的方法，通过将LLM的语言知识与机器人技能的可行性（affordance）结合，实现了自然语言指令到长horizon机器人任务的规划与执行。该工作首次展示了LLM如何在真实机器人上落地，开启了LLM+机器人的新范式。</description>
    </item>
    <item>
      <title>论文精读｜Gato：DeepMind的通用智能体——一个网络玩转604种任务</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/gato%E9%80%9A%E7%94%A8%E6%99%BA%E8%83%BD%E4%BD%93%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/gato%E9%80%9A%E7%94%A8%E6%99%BA%E8%83%BD%E4%BD%93%E7%B2%BE%E8%AF%BB/</guid>
      <description>Gato是DeepMind提出的通用智能体，通过在604种不同任务上联合训练，用一个Transformer网络同时处理 Atari 游戏、机器人控制、图像描述、文本对话等任务。它证明了单一模型可以掌握多种模态的技能，是迈向通用人工智能的重要一步。</description>
    </item>
    <item>
      <title>论文精读｜Open X-Embodiment：跨机器人大规模数据集与RT-X模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/open-x-embodiment%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/open-x-embodiment%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>Open X-Embodiment是Google联合21家机构打造的跨机器人大规模数据集，包含22种机器人、100万+轨迹数据。基于该数据集训练的RT-X模型首次证明了跨机器人正迁移的可行性，RT-1-X成功率提升50%，RT-2-X泛化能力提升3倍。</description>
    </item>
    <item>
      <title>论文精读｜DROID：大规模真实世界机器人操作数据集</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/droid%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%93%8D%E4%BD%9C%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/droid%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%93%8D%E4%BD%9C%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>DROID是Google联合18家机构打造的大规模真实世界机器人操作数据集，包含76k演示轨迹、564个场景、86个任务，跨越北美、亚洲、欧洲三大洲。实验证明使用DROID训练的策略在性能和泛化能力上平均提升20%。</description>
    </item>
    <item>
      <title>论文精读｜RH20T：面向拟人全身控制的机器人操作数据集</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rh20t%E6%8B%9F%E4%BA%BA%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rh20t%E6%8B%9F%E4%BA%BA%E6%9C%BA%E5%99%A8%E4%BA%BA%E6%95%B0%E6%8D%AE%E9%9B%86%E7%B2%BE%E8%AF%BB/</guid>
      <description>RH20T是上海交通大学推出的超大规模机器人操作数据集，包含110,000+条接触丰富的真实世界操作序列，覆盖147项任务、7种机器人配置。数据集提供视觉、力觉、音频等多模态信息，支持一次性模仿学习研究。</description>
    </item>
    <item>
      <title>论文精读｜Octo：开源通用机器人策略——大规模多任务机器人基础模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/octo%E9%80%9A%E7%94%A8%E6%9C%BA%E5%99%A8%E4%BA%BA%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/octo%E9%80%9A%E7%94%A8%E6%9C%BA%E5%99%A8%E4%BA%BA%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>Octo 是 UC Berkeley 等团队推出的开源通用机器人策略（GRP），基于 Transformer 架构在 80 万条多机器人轨迹上预训练，支持语言指令和目标图像双模式输入，可通过高效微调适配新机器人平台和动作空间。作为首个完全开源的通用机器人操控策略，Octo 为机器人基础模型的研究奠定了重要基础。</description>
    </item>
    <item>
      <title>论文精读｜OpenVLA：开源视觉-语言-动作模型——VLA走向开放生态</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/openvla%E5%BC%80%E6%BA%90vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/openvla%E5%BC%80%E6%BA%90vla%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型，在 97 万条真实机器人演示上训练，以 7 倍更少的参数超越闭源模型 RT-2-X（55B）。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干，结合 LoRA 微调和量化推理，OpenVLA 让 VLA 模型首次走向开放生态。</description>
    </item>
    <item>
      <title>论文精读｜DreamerV3：通过世界模型掌握多样领域——通用强化学习智能体</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/dreamerv3%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/dreamerv3%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>DreamerV3 是 DeepMind 提出的通用强化学习算法，通过学习世界模型并在想象中规划，以单一固定超参数配置在 150 多个多样化任务上超越专用算法。首次从零开始在 Minecraft 中收集钻石，标志着强化学习向通用化迈出了重要一步。</description>
    </item>
    <item>
      <title>论文精读｜UniSim：学习交互式真实世界模拟器——生成式世界模型</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/unisim%E4%BA%A4%E4%BA%92%E5%BC%8F%E4%B8%96%E7%95%8C%E6%A8%A1%E6%8B%9F%E5%99%A8%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/unisim%E4%BA%A4%E4%BA%92%E5%BC%8F%E4%B8%96%E7%95%8C%E6%A8%A1%E6%8B%9F%E5%99%A8%E7%B2%BE%E8%AF%BB/</guid>
      <description>UniSim 是由 Google DeepMind、UC Berkeley 和 MIT 联合提出的通用真实世界模拟器，通过生成式建模将互联网图像、机器人操作、人类活动等异构数据统一到一个动作输入-视频输出的框架中。该模型能够模拟从高层语言指令到低层机器人控制的各种交互，在视觉-语言规划、强化学习和视频描述等任务上实现了零样本真实世界迁移。</description>
    </item>
    <item>
      <title>论文精读｜EmbodiedGPT：基于具身思维链的视觉-语言预训练</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/embodiedgpt%E5%85%B7%E8%BA%AB%E6%80%9D%E7%BB%B4%E9%93%BE%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/embodiedgpt%E5%85%B7%E8%BA%AB%E6%80%9D%E7%BB%B4%E9%93%BE%E7%B2%BE%E8%AF%BB/</guid>
      <description>EmbodiedGPT 是由中国科学院上海AI实验室、香港大学等机构提出的端到端多模态具身基础模型，通过创新的&amp;rsquo;具身思维链&amp;rsquo;（Embodied Chain of Thought）范式，将视觉-语言预训练与具身规划紧密结合。该模型构建了大规模EgoCOT数据集，实现了从高层规划到低层控制的闭环系统，在具身规划、控制、视频描述和视觉问答等多个任务上取得了优异性能。</description>
    </item>
    <item>
      <title>论文精读｜VIMA：基于多模态提示的通用机器人操作——多模态大模型驱动机器人</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vima-multimodal-prompts-robot-manipulation/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vima-multimodal-prompts-robot-manipulation/</guid>
      <description>VIMA提出了一种统一的多模态提示接口，将多样化的机器人操作任务转化为序列建模问题。通过Transformer编码器-解码器架构和物体中心表示，VIMA在零样本泛化设置下任务成功率最高提升2.9倍。</description>
    </item>
    <item>
      <title>论文精读｜MOO：基于预训练视觉-语言模型的开放世界物体操作</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/moo-open-world-object-manipulation/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/moo-open-world-object-manipulation/</guid>
      <description>MOO利用预训练视觉-语言模型将自然语言指令与视觉物体定位相结合，实现了对从未见过的物体类别的零样本操作泛化，在真实机器人上达到约79%的成功率。</description>
    </item>
    <item>
      <title>论文精读｜LeRobot：让机器人学习触手可及——HuggingFace的开源机器人学习框架</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/lerobot-open-source-robot-learning/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/lerobot-open-source-robot-learning/</guid>
      <description>LeRobot是HuggingFace推出的开源机器人学习库，覆盖从底层电机控制到大规模数据集收集、存储和流式传输的完整栈，支持多种低成本机器人平台和SOTA学习算法。截至2025年9月，社区已贡献16K+数据集和数百个预训练模型，形成了去中心化的机器人数据收集生态。</description>
    </item>
    <item>
      <title>论文精读｜具身智能VLA模型综述：从视觉-语言到动作生成的技术全景</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/vla-survey-2024/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/vla-survey-2024/</guid>
      <description>首篇系统性综述视觉-语言-动作（VLA）模型的文章，从组件、控制策略和任务规划三个维度全面梳理了VLA模型的技术脉络，涵盖CLIP/R3M/DINOv2等视觉表征、RT-1/RT-2/OpenVLA等控制策略、SayCan/Code as Policies等任务规划方法，并深入探讨了安全、数据集、基础模型等挑战与未来方向。</description>
    </item>
    <item>
      <title>论文精读｜具身智能：形态、动作、感知与学习的协同——全面综述</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/embodied-intelligence-synergy-2025/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/embodied-intelligence-synergy-2025/</guid>
      <description>本文从形态、动作、感知与学习四个维度的协同关系出发，系统综述了具身智能的研究进展，强调智能是大脑、身体与环境紧密耦合的产物，并提出了统一的具身智能框架。</description>
    </item>
    <item>
      <title>论文精读｜虚实对齐：具身智能的全面综述——从仿真到真实的迁移</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/cyber-physical-alignment-2024/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/cyber-physical-alignment-2024/</guid>
      <description>本文从虚实对齐的视角全面综述具身智能，系统分析了具身感知、具身交互、具身智能体和仿真到真实迁移四大研究方向，深入探讨了多模态大模型在虚拟和现实具身智能体中的应用。</description>
    </item>
    <item>
      <title>RT-2精读：VLA奠基之作——将网络知识迁移到机器人控制</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-2%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/rt-2%E7%B2%BE%E8%AF%BB/</guid>
      <description>RT-2 由 Google DeepMind 提出，首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型，让网络知识迁移到具身控制，使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力，是 VLA 范式的奠基之作。</description>
    </item>
    <item>
      <title>论文精读｜Diffusion Policy：扩散模型做机器人动作生成</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-policy%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/diffusion-policy%E7%B2%BE%E8%AF%BB/</guid>
      <description>Diffusion Policy 将机器人动作生成重新定义为条件去噪过程，让策略网络从噪声中逐步雕刻出动作序列。它天然支持多模态动作分布与高维动作空间，解决了传统行为克隆的 mode averaging 和复合误差问题。经 CNN 和 Transformer 双架构验证，成为后续 π0、Qwen-VLA 等 VLA 模型动作头设计的奠基之作。</description>
    </item>
    <item>
      <title>论文精读｜ACT &#43; ALOHA：低成本双臂遥操作与动作分块策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/act-aloha%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/act-aloha%E7%B2%BE%E8%AF%BB/</guid>
      <description>ACT+ALOHA 用不到 2 万美元的开源双臂遥操作平台解决了精细双臂操控的数据获取难题。ACT 采用动作分块（Action Chunking）+CVAE Transformer 的抗复合误差策略，将模仿学习精度推至新高度。ALOHA 的低成本同构主从机械臂设计为具身智能数据采集建立了新范式。</description>
    </item>
  </channel>
</rss>
