写在前面:这篇文章为谁而写

我自己从自动驾驶转向具身智能方向,这篇文章就是我的入职前学习总纲——把我查过的公开资料、读过的论文、站内已有的 100+ 篇文章,整理成一条可以从头走到尾的路径。你有三个别人没有的起点:

  1. 你做过端到端:UniAD/VAD/DiffusionDrive 这套「感知直连规划」的直觉,正是 VLA 的骨架;
  2. 你做过世界模型 + Flow Matching 动作专家:这是 2026 年具身最热的两条技术线的正中心;
  3. 你做过 GRPO/Flow-GRPO 后训练:具身策略的后训练配方和你在自动驾驶上调过的几乎同源。

所以这篇文章不教你「什么是 Transformer」,它解决的是:怎么把自驾的存量能力,快速折算成具身的战斗力,并补齐那几块真正新的课。

全文八部分:

① 大图景   具身智能是什么 + 2026 行业坐标 + 方奇科技怎么读
② 迁移地图 自动驾驶九项能力 → 具身对应物(+ 五个不能搬的差异)
③ 知识栈   八块要学的:机器人学 / 模仿学习 / VLA / 仿真 / 世界模型 / 数据 / RL / 系统
④ 论文地图 30+ 篇分层必读,每篇一句「解决什么」+ 站内精读链接
⑤ 动手计划 8 周:从跑通 LeRobot demo 到复现 VLA + RL 后训练
⑥ 定向准备 方奇科技的技术主张与面试高频题
⑦ 资源清单 站内索引 + 外部仓库 / 基准 / 关注列表
⑧ 自测 Q&A 10 道题检验「真的入门了吗」

一、大图景:具身智能到底是什么

1.1 一句话定义

具身智能(Embodied AI)= 智能体通过「身体」在物理世界里感知、决策、行动,形成闭环。 与之相对的是「离身智能」——ChatGPT 这类系统输入输出都是数字信号,错了可以撤回;机器人推倒了杯子,杯子就碎了。这个差异决定了具身智能的全部技术形态:必须处理不确定性、必须在环、必须为失败付出真实代价。

这条线的思想源头可以追到图灵 1950 年代的设想,中间经历行为主义机器人、深度强化学习(AlphaGo/机械狗)、大模型三个浪头,到 2025-2026 年才因为「VLM/VLA 成熟 + 资本涌入」真正爆发。中国人工智能学会的《具身智能白皮书(2026)》把核心技术归纳为:感知、推理、操作、导航、交互的闭环,其中具身大模型(VLA、WAM 范式)是核心,虚实结合(仿真/世界模型)是重要方向。

1.2 任务谱系:先知道自己进的是哪个坑

方向干什么代表系统数据/评测特点
操作(Manipulation)手臂/双臂抓取、放置、装配、工具使用π0、OpenVLA、RDT、ALOHA本文主战场,方奇的「立体清洁」属于此类延伸
导航(Navigation)移动、避障、语义寻址扫地机器人、配送机器人和自驾最像,但地图是室内语义级的
人形(Humanoid)双足全身控制 + 操作Figure、宇树、智元本体最难,大脑往往外挂 VLA
多机协作群体分工、人机共融工厂集群、编队前沿,先了解即可

入门 80% 的精力应放在「操作」上:它是 VLA 论文的主战场、数据集最全、评测最成熟,也是大多数大脑公司的核心场景。

1.3 技术栈:一座六层大厦

具身智能六层技术栈,以及自动驾驶背景的覆盖范围

从下往上读:

  • L1 本体硬件:人形/双臂/轮式本体、关节电机、夹爪还是灵巧手、相机/力矩/触觉传感器——这一层是「具身」的字面意思,也是自动驾驶完全没有的对象;
  • L2 运动控制「小脑」:正逆运动学、雅可比、阻抗与力控、千赫兹级实时控制环——自驾最该补的一层:车是「你给轨迹我跟上」,机械臂是「你给末端位姿我要解算几十个关节怎么转、碰到东西该软还是该硬」;
  • L3 智能「大脑」:VLA、世界模型/WAM、VLM 推理、RL 后训练——资本最密集的一层(2026 上半年具身融资超一半流向「大脑派」,其中 VLA 占 42%、世界模型占 27%、数据基础设施占 20%,本体厂商只拿到不到 20%);
  • L4 数据引擎:遥操作采集、人类视频、Real2Sim 合成、失败归因采数——行业的「卡脖子」层(下文 1.4);
  • L5 仿真与评测:Isaac Lab/MuJoCo、Sim2Real 鸿沟、LIBERO/RoboCasa、开环 vs 闭环;
  • L6 系统与部署:ROS2、推理加速、安全熔断、云端大脑 + 端侧小脑。

你的迁移画像:L3L6 的方法论基本可迁移(端到端、扩散/Flow、GRPO、世界模型直觉、数据闭环、评测回归、部署加速),L1L2 和 L3 里的「动作空间」是全新课。蓝色区是你带过去的本钱,黄色区是入职前要补的账。

1.4 2026 行业坐标:三个必须知道的数字

  1. 钱往哪流:2026 上半年具身融资总额 1041 亿元,超过 2025 全年近一倍;结构上是「重大脑、轻本体」——VLA 42%、世界模型 27%、数据 20%。这意味着算法岗(大脑)是行业主战场,你赶的时机是对的。
  2. 数据缺口 99%:VLA 要达到通用自主,量级估计需要千万小时级高质量真实交互数据;截至 2026 年初全球合规可用的机器人数据只有约 50 万小时。和自驾「数据靠车队滚雪球」不同,机器人没有车队——所以 Real2Sim、人类视频、仿真合成、失败归因这些「造数据」的技术才这么卷。
  3. 量产 ≠ 落地:2026 年人形机器人整机产量有望破 10 万台(2025 约 2 万台),宇树科创板 IPO 获批;但大量出货仍在科研教育场景,工业/商业落地刚起步。行业共识从「能走能跳」转向「能想会决策」——这正是大脑公司的机会窗口。

还有一个来自业界的判断框架值得记:一个领域要爆发,需要三次可规模化的范式突破——可规模化预训练、可规模化对齐、可规模化商业化部署(LLM、自动驾驶都走完了这三步)。VLA/世界模型目前处在第一步的中段、第二步的早期。面试聊「你怎么看行业阶段」,这套框架比背融资数字高级得多。

1.5 方奇科技怎么读:你的下一站(基于公开报道整理)

以下全部来自公开报道(2026-09-21 融资新闻、北京日报、机器人大讲堂、金融界等),入职后以内部信息为准。

基本盘:方奇科技(北京)有限公司,2026 年 2 月成立,北京海淀,定位「具身智能通用大脑研发企业」;成立 7 个月即完成千万级天使轮(启迪之星创投等)。创始人王心舟,1996 年生,本硕北京航空航天大学、博士师从清华大学计算机系孙富春教授,深耕具身智能、三维视觉与多模态生成大模型,创业前参与腾讯混元 3D 模型与物理 AI 算法架构设计;团队核心均来自清华大学,覆盖世界模型、VLA 算法、云原生系统与商业化全链路。

技术主张(这是面试最可能被深挖的部分):

主张内容对应你需要准备的知识
问题诊断泛化弱的根因 = 世界模型缺乏人类知识,具身大脑缺乏物理常识,即物理知识与语义知识的割裂世界模型 vs VLA 的能力边界(你有驾驶世界模型经验,直接能聊)
语义化世界模型把具身大模型与世界模型深度耦合,将视觉、语言、物理状态组织到统一的三维语义空间三维表征、多模态对齐、WorldArena 类评测(Ctrl-World 是 2026 年的标杆)
图灵学习范式课程学习 → 任务学习 → 实践学习 → 反思学习的链路,打破传统遥操「只知其然」,让机器人从人类数据与真实实践中持续学习模仿学习的局限、自我改进/RSI 论文(站内 Zetta/EmbodiRSI 精读)
架构路线云端大脑(多模态大模型)+ 端侧小脑 + 实时孪生世界模型(中间件),本体无关、跨本体复用云边协同、模型蒸馏、跨本体动作空间归一化
产品叙事沉淀「通用技能操作系统」:具身能力的学习、沉淀、分发基础设施;以立体清洁为首个商业化练兵场技能库抽象(Voyager/ROCKET 系)、场景闭环
进化飞轮图灵学习 × 语义化世界模型 = 云原生具身大脑的成长飞轮数据闭环 + 世界模型仿真 + RL 后训练的组合

一句话把它放进你的知识地图:方奇做的是「VLA 与世界模型的耦合层」——你自驾做的 Cosmos/WAM 类工作(预测 state+action 联合分布)正是这个方向的近亲,这是你面试时最值钱的一句话:「我在车上做的世界动作模型,和贵司语义化世界模型要解决的物理-语义割裂,是同一个问题的两种参数化。」

1.6 术语表(先混个脸熟,后文直接用)

术语含义
VLAVision-Language-Action:图像+语言 → 动作的端到端策略
WAMWorld Action Model:联合预测 state + action 的「世界-动作模型」
本体 / Embodiment机器人的物理身体形态(双臂、夹爪、灵巧手…)
自由度 DoF独立可控的关节数,14-DoF 双臂 = 每臂 7 轴
末端 / EEFEnd-Effector,夹爪尖那一点的位姿
遥操作 Teleoperation人远程控制机器人采集示教数据
动作块 Chunk一次输出未来 10~100 步动作,而非单步
示教 / Demonstration一条「怎么做对」的示范轨迹
Sim2Real仿真里训练、真机上部署的迁移
域随机化训练时随机化物理/视觉参数以缩小仿真-真机差距
IL / BC模仿学习 / 行为克隆:照着示教抄动作
DAgger让策略自己犯错、专家现场纠正、数据回灌的迭代算法
RSIRecursive Self-Improvement,递归自我改进

二、迁移地图:自动驾驶的存量怎么折算

自动驾驶九项能力到具身的迁移对照

九项能力逐条说(左列自驾、右列具身,差异在括号里):

  1. BEV/3D 感知 → 工作空间理解:从「道路上的车流占据」换成「桌面上的物体 6D 位姿、支撑关系、可操作性」。相机配置也变了:头顶相机 + 双腕部相机的近距离、大畸变、自遮挡视角。(自驾靠 LiDAR+BEV 深度先验,具身多数只有 RGB,深度靠学习或双目。)
  2. 轨迹规划 → 动作块:自驾输出 3 秒8 秒的轨迹点(10Hz 级);具身输出未来 10100 步的关节/末端动作块(50Hz 级),且是序列生成问题(扩散/流匹配很吃香)而非回归问题。
  3. 端到端 UniAD/VAD → VLA:骨架完全同构——「一个网络从观测直出控制」。差别是自驾的输出是轨迹、目标函数是舒适与安全;VLA 的输出是动作、目标函数是任务完成,而且多了一个语言输入(指令改变了动作的语义)。
  4. 扩散/Flow Matching 规划器 → Diffusion Policy / 动作专家:这是你最值钱的技能之一。π0 的 flow matching 动作专家、RDT 的扩散双臂策略,和你在车上做的轨迹分布建模是同一套数学——只是把「道路可行驶域」换成「关节构型空间」。
  5. GRPO/RLHF 后训练 → 机器人 RL:reward 从「碰撞/舒适/合规」变成「任务成功 + 接触惩罚」;站内 Flow-GRPO 完整指南 的方法论直接平移,新概念是 DAgger(专家在环纠正)与 RSI(失败驱动的递归自改进)。
  6. 驾驶世界模型 → 具身世界模型:你做 MOT/Cosmos 类「预测未来观测/状态」的直觉完全适用;具身的升级点是必须把 action 纳入联合预测(做这个动作世界会怎样),并要保住接触、稳定、力这些控制相关变量——这正是方奇「物理-语义割裂」议题的技术腹地。
  7. 数据闭环/长尾挖掘 → 失败归因采数:自驾是「从路采里挖难例」;具身是「从 rollout 里归因失败格子,把示教定向砸向弱点」(EmbodiRSI 的 ADC 就是这套)。
  8. 开环/闭环评测 → 仿真基准 + 真机试验:NAVSIM 的「指标体系 + 回归检测」方法论照搬;对象换成 LIBERO/RoboCasa 的成功率、以及真机 10 次试验的均值±方差。记住具身的两条铁律:训练时开环误差低没用,闭环成功率才算数;测试时必须关掉所有辅助(agent 接管/人工纠正)。
  9. 车端部署 → ROS2 + 端侧小脑:部署直觉(量化、算子、延迟预算)通用;新增 ROS2 通信栈与「云端大脑低频决策、端侧小脑高频执行」的分层。

五个不能直接搬的差异(面试必聊,也必踩的坑)

#自驾具身后果
1数据海量:车队每天百万公里数据稀缺:真机遥操作一小时产几分钟有效数据不能迷信 scaling,要靠仿真合成与数据配比
2接触稀少:主要与地面滚动接触接触是任务本身:抓、插、拧全是接触动力学亚厘米误差就失败;力/触觉信号地位大增
3控制分层清晰:10Hz 规划、底盘执行频率耦合:策略 50Hz 出动作,底层 1kHz 控制动作表征(绝对/相对/delta)选错直接训崩
4不可重置:一次路采就一次可重置:仿真里同一个初始状态试一千次评测协议完全不同(固定种子 vs 分布采样)
5安全兜底成熟:规则兜底+冗余安全体系刚起步:熔断+物理限位+人机隔离安全模块是新岗位机会(可复用你的功能安全经验)

你的三个项目怎么翻译成具身语言

站内 三大项目面试全书 里的项目,面试时这样「转译」:

  • RiskField-VLA(风险场 VLA) → 「我做过语言条件化的风险代价函数嫁接到端到端策略,对应具身里『安全约束进 VLA』——接触安全、可恢复性约束是同一个问题的物理版」;
  • TrustDrive-WAM(世界动作模型) → 「我做过state+action 联合预测的世界动作模型,与贵司语义化世界模型要打通的物理-语义割裂是同构问题;差异在我那边重长时序预测,机器人这边重接触与因果」;
  • JEPA-DRIVE → 「我做过在潜空间预测未来表征而非像素,对应具身世界模型里『表征学习 vs 像素渲染』的路线之争(JEPA vs 视频生成),我知道哪类任务各自划算」。

三、知识栈:八块要学的东西(每块给「为什么 + 学什么 + 自检标准」)

A. 机器人学基础(薄薄一层,但必须有)

为什么:不理解正逆运动学,看不懂动作空间;不理解阻抗控制,不明白为什么「位置控制的机械臂碰到桌子会抖」。

学什么(两周内用到什么学什么,不必啃完整本教材):

  • 刚体变换与坐标系(SE(3)、齐次变换)——你做 BEV 标定时已会一半;
  • 正运动学(DH 参数)与逆运动学:给定夹爪位姿求关节角(解析解/数值解);
  • 雅可比矩阵:关节速度 ↔ 末端速度的换算,奇异点是什么;
  • 阻抗/导纳控制:为什么抓鸡蛋要「软」、插轴孔要「顺从」——具身论文里 compliance 是高频词;
  • 夹爪(二指/吸盘)vs 灵巧手(多指)的控制差异;
  • 手眼标定(相机-末端外参)——对标你的相机成像与标定经验。

学法:不用报课,直接看 modern-robotics 教材对应章节 + LeRobot 文档里的 action space 部分,动手在仿真里把「末端画 8 字」跑通。

自检:能回答「为什么 VLA 输出经常用相对位姿(delta)而不是绝对关节角?」

B. 模仿学习与操作数据的基本功

为什么:具身 90% 的落地模型是模仿学习产物;不懂数据怎么来、怎么标,模型代码读不懂。

学什么:

  • IL vs RL:行为克隆(BC)的分布漂移问题;DAgger 如何用「专家纠正」解决它;
  • 动作表示四件套:关节角 / 末端位姿(6D) / 相对增量 / 速度指令——不同数据集用不同表示,读论文先看这个;
  • 动作块(action chunking)与时间编码:为什么一次预测一整段(抑制漂移、降推理频率);
  • 遥操作方案:ALOHA(双臂主从)、GELLO、VR 手柄、动捕手套——数据从哪来的感性认识;
  • 两条基线算法吃透:ACT(Transformer + CVAE 逐 token 出动作块)与 Diffusion Policy(扩散去噪生成动作序列)——它们是后续所有 VLA 动作头的「Hello World」;
  • 数据集格式:RLDS(谷歌系)、LeRobot parquet(社区系)的 episode 结构。

学法:站内 Diffusion-Policy 精读 + ACT-ALOHA 精读 + DiffusionPolicy 代码讲解;数据集看 DROID 精读 与 Open-X-Embodiment 精读。

自检:给你一条 episode,能说出哪列是观测、哪列是动作、动作块长度多少、坐标系是哪个。

C. VLA 深水区(你的主攻方向)

为什么:这是大脑公司的核心岗,也是面试 60% 的考点。

必须搞清的四条线:

  1. 族谱线:RT-1(离散动作 token)→ RT-2(把动作当文本输出,VLA 概念成型)→ OpenVLA(开源 7B 底座)→ π0(VLM + flow matching 动作专家,高频动作输出的工业标杆) → GR00T N1.5(人形,双系统快慢脑)→ Qwen-VLA/RDT(中文生态与双臂)→ 2026 前沿(π0.7、τ0-VLA 等)。
  2. 架构线:视觉编码器(ViT/DINOv2)+ VLM 主干(冻结/LoRA)+ 动作头三选一:离散 token(分类损失)、扩散/流匹配(去噪损失,你的主场)、自回归连续(回归损失)——各自的延迟/精度/多模态性 trade-off 要能背。
  3. 训练配方线:动作数据与图文数据混合预训练(防 VLM 退化)、**重采样(resampling)**平衡长尾任务、动作归一化、chunk 长度与推理频率的关系、共训(co-training)配比——这些「炼丹细节」在 VLA 大模型训练技巧 有系统总结。
  4. 评测线:LIBERO 四套设置(Spatial/Object/Goal/10)、RoboCasa、真机评测协议;开环 MSE 为什么不可信(站内 开环评测vs闭环评测)。

学法:先读 什么是VLA模型 建立骨架 → 前沿VLA模型全景速览 看族谱 → 精读 π0(有配套 π0 代码讲解)与 RDT与RDT2精读 → 训练配方读 VLA 大模型训练技巧。

自检:能白板画出 π0 的前向路径,并解释「为什么动作专家要用 flow matching 而不是直接回归?」

D. 仿真与 Sim2Real

为什么:真机贵、慢、危险,仿真训练是具身的「路测」;同时具身最独特的失败模式(仿真里 90%、真机 40%)全在这层。

学什么:

  • 三大仿真器定位:Isaac Lab(GPU 并行、大规模 RL)、MuJoCo(接触物理准、学术经典)、ManiSkill/SAPIEN(操作任务库)——知道各自生态即可;
  • Sim2Real 鸿沟的三大来源:视觉差(渲染 vs 真实)、动力学差(摩擦/质量/延迟)、观测差(相机噪声/标定);对应三板斧:域随机化、系统辨识、域适应;
  • 评测协议:固定种子 vs 随机种子、开发集与留出集隔离、成功率±方差报告——读 Zetta 与 EmbodiRSI 精读 时注意它们防「评测污染」的制度设计;
  • 基准扫盲:LIBERO、RoboCasa、SimplerEnv、CALVIN、RLBench(按常用度排)。

自检:「仿真成功率 90% 真机只有 50%,按优先级列出你会先查哪三个原因?」(答案常排前三位:相机视角/标定、接触摩擦、动作延迟对齐。)

E. 世界模型(你最顺手的一块,但要换战场)

为什么:方奇的核心主张之一;也是 2026 年资本第二流向(27%);更是你自驾经验最容易兑现的地方。

先统一定义:世界模型 = 对「给定状态与动作,世界下一步会怎样」的可学习建模,三件套是表征(state 表示)+ 动力学(转移预测)+ 推演(rollout 规划/评测)。做自动驾驶的你习惯叫它「驾驶世界模型」,具身的行话有几个变体:

变体与你熟悉的对应物关键差异
视频世界模型(Genie/UniSim/Cosmos 系)Cosmos 世界基础模型具身版要动作可控(action-conditioned),否则没法做策略推演
WAM 世界动作模型你的 TrustDrive-WAM状态+动作联合预测,落地三用途:推演评测、数据合成、RL 环境
潜在/表征世界模型(Dreamer/JEPA 系)你的 JEPA-DRIVE在潜空间想象,避开像素重建的算力与伪影
语义化世界模型(方奇主张)——把物理状态与语言/语义统一到三维语义空间,解决「物理-语义割裂」

学什么:先读 什么是世界模型 打底 → 驾驶世界模型全景详解 复习你的主场 → DreamerV3 精读 与 UniSim 精读 补两条路线 → GigaWorld-0 精读 与 Cosmos3 精读 看 2026 工业级做法 → 最后读 Zetta 与 EmbodiRSI 精读 看世界模型如何与递归自改进(RSI)结合。

具身世界模型特有的三个考点:

  1. 推演评测(rollout-based eval):用世界模型代替部分真机试验来评策略——方奇/EmbodiRSI 这类「仿真-数据-评测」闭环都在这条线上;
  2. 物理接地:光会生成好看的视频不算世界模型,要能预测接触、稳定性、力——这也是 Motis 类立场论文(2026)对当前世界模型「物理与语义割裂」的批评;
  3. 与 VLA 的关系:三条路线要能讲清——世界模型服务 VLA(做推演/数据/RL 环境)、世界模型内化进 VLA(WAM 一体)、世界模型主导 VLA(想象中规划)。方奇的「耦合」主张属于二三之间。

自检:「同一个任务,用世界模型评策略和真机实测,结果不一致你会怎么查?」(模型偏差、分布外状态、奖励代理与真实目标不对齐……能列三层就达标。)

F. 数据工程(行业卡脖子处,也是自驾人最能降维的地方)

为什么:数据缺口 99% 意味着谁会造数据谁就有护城河;你在自驾做的是「路采→归因→挖掘→回灌」,这套方法论在具身是稀缺能力。

学什么:

  • 数据来源金字塔:真机遥操作(质量高、贵)> 真机自主探索 > 人类视频(YouTube/EPIC,便宜但无动作标签)> 仿真合成(Real2Sim/大规模渲染)> 世界模型生成(质量存疑,需验证);
  • 主流数据集地图:Open-X-Embodiment(22 种本体 100 万+ 轨迹)、DROID(564 场景 76k 轨迹)、BridgeData、RH20T、LIBERO——各自的本体、指令分布、动作空间(站内均有精读);
  • 核心矛盾:跨本体——不同机器人的 DoF 不同、动作空间不同,怎么归一化训练(本体标记 embodiment token、统一到末端空间、动作分词器)——这直接对应方奇「本体无关」的产品主张;
  • 数据配比与归因采数:任务间/本体间/图文-动作数据的配比;失败格子定向补采——你的数据闭环经验直接平移(数据闭环工程)。

自检:「新场景只有 20 条真机示教,怎么把它放大成能训练 VLA 的数据集?」(仿真增广 + 语言改写 + 世界模型 rollout 筛选 + 远程协作补采,答出组合拳即可。)

G. RL 与后训练(你的第二主场)

为什么:模仿学习封顶在「示范者水平」,超过示范者只能靠 RL;而 2026 年具身后训练的主流正是你用过的 GRPO 家族。

学什么:

  • 基础补缺:强化学习基础详解、离线强化学习详解(离线 RL 对机器人很关键——真机不能无限试错);
  • 主线:SFT(模仿)→ RL 微调的配方;奖励设计(任务成功 0/1 + 接触/能耗塑形);GRPO 方法 → Flow-GRPO 详解(扩散/流匹配策略的 RL,站内有完整指南);
  • 机器人特有算法:DAgger(专家纠正回灌)、RFT/DPO 变体(按偏好筛轨迹)、RSI 递归自改进(失败→归因→补数据→再训的飞轮,Zetta 与 EmbodiRSI 是 2026 的两篇代表作);
  • 关键 trade-off:RL 训练在仿真还是真机?(真机 RL 需要安全层 + 世界模型做代理环境——又回到你的主场)。

自检:「Behavior Cloning 学到 85% 成功率,剩下 15% 怎么办?」(DAgger 纠错 + RL 稀疏奖励 + 针对性补采,三段式回答。)

H. 系统与部署(入门够用即可,别陷进去)

学什么:ROS2 话题/服务/TF 树的基本盘(ROS2 入门);实时性预算(策略 50Hz 出块、底层 1kHz 闭环);云端大脑(低频推理)+ 端侧小脑(高频执行)的分层部署——这正是方奇「云原生具身大脑」的架构叙事;模型侧的量化/蒸馏经验直接沿用自驾。

自检:「VLA 推理一次 100ms,但控制环要求 50Hz,你怎么设计?」(动作块 + 异步推理 + 端侧插补,你部署过的直觉直接适用。)


四、论文地图:30+ 篇怎么排优先级

规则:L0~L2 必读(约 15 篇,配合站内精读 23 天可扫完),L3L5 按方向选读,L6 综述扫目录。标 ⭐ 的是站内有全文精读/代码讲解的。

L0 · 概念奠基(4 篇,知道「VLA 从哪来」)

论文一句「解决什么」站内
SayCan语言模型选「最有用的行为」——给 LLM 装上「能做什么」的身体约束精读
PaLM-E多模态大模型进机器人:图像+语言+状态统一大脑精读
RT-1Transformer 直接从图像出动作 token,证明可规模预训练精读
RT-2VLA 概念成型:把动作当「文本」输出,复用 VLM 全部常识精读

L1 · 操作基础(4 篇,动作头的「Hello World」)

论文一句「解决什么」站内
Diffusion Policy ⭐扩散模型生成动作序列,解决多模态动作分布精读 + 代码
ACT(ALOHA) ⭐CVAE + Transformer 出动作块,低资源双臂学习精读
Gato一个网络玩所有模态,通用智能体雏形精读
EmbodiedGPT具身思维链:CoT 让机器人任务分解可解释精读

L2 · 现代 VLA 主干(6 篇,面试主战场)

论文一句「解决什么」站内
OpenVLA ⭐开源 7B VLA 基线,离散动作 token 路线精读
π0 / π0.5 ⭐flow matching 动作专家——高频连续动作的工业标杆,与你 Flow Matching 经验同源精读 + 代码
RDT / RDT-2 ⭐双臂 16-DoF 扩散基线,动作空间扩到全身精读
Octo可微调的开源通用策略,LoRA 式适配精读
GR00T N1.5人形双系统「快脑/慢脑」,NVIDIA 数据引擎打法在 全景速览 中覆盖
VLA 安全综述 ⭐VLA 的安全威胁分类——具身安全岗的入场券精读

L3 · 数据与基准(4 篇,聊「数据从哪来」的底气)

  • Open-X-Embodiment ⭐(精读)——跨本体数据集的「ImageNet 时刻」;
  • DROID ⭐(精读)——真实家居分布、可泛化性标杆;
  • RH20T(精读)——拟人双臂 + 传感器全模态;
  • LIBERO(精读)——事实上的 VLA 开发基准四件套。

L4 · 世界模型线(5 篇,你的主场延伸)

  • DreamerV3(精读)——「在想象里练出真本事」的奠基;
  • UniSim(精读)——交互式模拟器路线;
  • Cosmos-3(精读)——工业级世界基础模型 + 你熟悉的后训练组合;
  • GigaWorld-0(精读)——数据引擎路线;
  • GigaWorld-1 / WMBench(arXiv 2607.02642,2026)——从「建世界模型」转向「用世界模型评策略」的基准与路线图,正好接在你 TrustDrive-WAM 的延长线上。

L5 · 2026 前沿(6 篇,追热点用)

方向论文看点
RSI 递归自改进Zetta(精读)Agent Harness 驱动的 L1→L5 自我改进体系
RSI 落地闭环EmbodiRSI(同上文)Real2Sim2Real + 失败归因采数的完整制度
测试时计算τ0-VLA(arXiv 2608.16885)分层机器人基础模型 + 世界模型引导的 test-time search
世界模型基准GigaWorld-1/WMBench(见上)世界模型作为策略评测器
通用底座π0.7(2026)可引导的通用机器人基础模型、涌现能力
立场与批评Motis 系立场论文(arXiv 2606.06556)指出四个缺失组件:物理数据引擎、跨本体任务保留、物理接地世界模型、自我改进部署循环——直接呼应方奇的「物理-语义割裂」判断

L6 · 综述扫目录(3 篇,快速建地图)

  • 《Embodied AI: From LLMs to World Models》(arXiv 2509.20021,清华/复旦系)——LLM→VLA→世界模型的演进主轴;
  • 《World Models for Embodied AI》(arXiv 2510.16732)——世界模型在具身的系统分类;
  • 中国人工智能学会《具身智能白皮书(2026)》——中文体系 + 产业政策视角,面试聊「行业怎么看」的语料库。

站内还有这些顺路读:lerobot 开源框架、前沿VLA模型全景速览、VLA vs 感知之争——完整的 具身智能 分类索引见第七部分。


五、动手计划:8 周从「读过」到「跑过」

原则:每周必须有可运行的产出(notebook/脚本/对比表),读论文不产生肌肉记忆。以下默认你入职前有完整 8 周;时间紧就压缩成「4+4」(第 1-2 周并入第 3-4 周)。

第 1-2 周 · 地图周:环境 + 数据体感

任务交付物
装好 LeRobot(模拟器 + 预训练 checkpoint),跑通 SO100/ALOHA 模拟臂 demo屏幕录像 + 环境文档
下载一条 Open-X 或 DROID episode,可视化观测与动作序列可视化 notebook:episode 结构图
读 L0 全部 4 篇 + 站内 什么是VLA、什么是世界模型一页纸族谱:RT-1→RT-2→OpenVLA→π0
手推一遍「正运动学→逆运动学」,在仿真里让末端画 8 字30 行脚本

第 3-4 周 · 基线周:亲手训一个

任务交付物
在 LIBERO(或 SimplerEnv)上复现 Diffusion Policy 或 ACT 训练训练曲线 + 成功率表
用 LeRobot 微调一个 OpenVLA/π0 checkpoint 到新指令分布微调前后成功率对比
消融一个训练配方旋钮:action chunk 长度 / 重采样 / 归一化300 字结论:哪个最敏感
读 L1+L2 主干 8 篇(用站内精读省一半时间)面试用白板图:π0 前向路径

第 5-6 周 · 世界模型周:把主场变成武器

任务交付物
跑通一个 action-conditioned 世界模型 rollout,做一次「虚拟评测 vs 真实/仿真评测」对照一致性分析表:哪里不可信
把你 TrustDrive-WAM 的经验写成一页「自驾 WAM → 具身 WAM」的迁移备忘一页纸(面试直接用)
读 L4 世界模型 5 篇 + Zetta/EmbodiRSI 精读RSI 飞轮手绘图:失败→归因→补采→再训

第 7-8 周 · 后训练周:RL + 查漏 + 面试弹药

任务交付物
用 GRPO/Flow-GRPO(站内完整指南)在小任务上做一次策略 RL 微调成功率提升曲线 + reward 设计笔记
实现或跑通一次 DAgger:让策略犯错、专家纠正、回灌再训「BC 封顶问题」的实证数据
L5 前沿 6 篇扫读 + 方奇全部公开资料整理面试问题清单 20 条(带自己的答案)
三大项目按 面试全书 的「自驾→具身转译」口述 3 遍3 分钟第一人称录音 ×3

每天节奏建议:上午 2h 动手(别碰手机),下午 1.5h 论文 + 站内精读,晚上 0.5h 把当天结论写进求职笔记。第 2 周起每周至少一次「假设入职被问 X」的模拟回答。


六、定向准备:面向方奇科技的面试弹药

基于公开报道整理,入职后以内部为准。

6.1 必须能讲的五个问题

  1. 「世界模型和 VLA 是什么关系?」——用三条路线回答(服务型/一体型/主导型),落点在「贵司的语义化世界模型是把两者在三维语义空间里耦合,解决物理知识与语义知识割裂」。
  2. 「你怎么理解图灵学习范式?」——课程→任务→实践→反思四段链路;对比遥操作示范「只知其然」的局限;接上你做过的「失败归因→定向补采」闭环。
  3. 「数据从哪来?」——金字塔(遥操作/人类视频/仿真/Real2Sim/世界模型生成)+ 跨本体归一化 + 99% 缺口的行业背景。
  4. 「自驾经验对你有什么用?」——直接用第二部分的九项迁移表 + 五个差异(讲差异比讲迁移更能体现你真懂)。
  5. 「立体清洁为什么能先落地?」——结构化、可验收、容错高、数据可沉淀;这是「练兵场」而非「终点」的商业逻辑。

6.2 你比纯具身候选人多的五张牌

  • Flow Matching 动作专家:π0 系工业标杆的底层数学你在车上就写过;
  • WAM 世界动作模型:state+action 联合预测的第一手经验,直接对话「语义化世界模型」;
  • GRPO/Flow-GRPO 后训练:具身后训练主流配方的完整工程链路;
  • 数据闭环方法论:具身最缺的「归因-采数-回灌」组织能力;
  • 开/闭环评测与回归制度:具身评测还很草莽,你的 NAVSIM 类经验是降维。

6.3 反问清单(面试尾声用,选 2~3 个)

  1. 语义化世界模型目前的评测方式是什么?世界模型 rollout 在多大程度上替代了真机试验?
  2. 团队的动作数据以遥操作为主还是以仿真/Real2Sim 为主?跨本体的归一化方案定型了吗?
  3. 图灵学习范式里「反思学习」的信号来自哪——自动失败检测、人工标注还是世界模型 critic?
  4. 云端大脑与端侧小脑的职责切分线在哪?端侧跑的是蒸馏后的策略还是原模型?
  5. 第一个商业化场景(立体清洁)的数据飞轮已经转起来了吗?闭环里最难的一环是什么?

七、资源清单

7.1 站内索引(按阅读顺序)

入门四件套:什么是VLA模型 → 什么是世界模型 → 前沿VLA模型全景速览 → VLM视觉语言模型入门详解

技术深水区:VLA大模型训练技巧 · 驾驶世界模型全景详解 · Flow-Matching入门详解 · Flow Matching与扩散模型统一视角 · 扩散模型基础详解 · GRPO强化学习方法详解 · Flow-GRPO详解 · 离线强化学习详解 · JEPA联合嵌入预测架构详解

工程与评测:ROS2入门 · 数据闭环工程 · 开环评测vs闭环评测深度解析 · 仿真器搭建与闭环测试

论文精读(具身智能分类精华):π0 · OpenVLA · RDT与RDT2 · Diffusion Policy · ACT-ALOHA · DROID · Open-X · LIBERO · Octo · RT-1 · RT-2 · SayCan · PaLM-E · Gato · Zetta与EmbodiRSI · DreamerV3 · UniSim · Cosmos3 · GigaWorld-0 · VLA安全综述——链接见第四部分论文地图。

代码讲解:π0代码 · DiffusionPolicy代码 · AutoVLA代码

面试与规划:三大项目面试全书 · Flow-GRPO完整指南 · 自动驾驶学习路径 · VLA与感知之争

7.2 外部资源

  • 动手框架:LeRobot(首选,文档友好)· OpenVLA · openpi(Physical Intelligence π0 开源栈)· Isaac Lab · ManiSkill
  • 数据集门户:Open-X(RLDS 格式样例最多)· DROID · LIBERO
  • 跟踪前沿:arXiv 的 cs.RO + cs.LG 交叉、Hugging Face Daily Papers 的 robotics 标签、WorldArena 世界模型排行榜、世界人工智能大会/世界机器人大会的具身专场
  • 中文源:机器人大讲堂、量子位/机器之心的具身专栏、中国人工智能学会具身智能白皮书

八、自测 Q&A:10 道题检验是否「真的入门」

1. VLA 和传统「感知-规划」流水线的本质区别是什么? 不是模块变粗了,而是动作进入了梯度:损失函数直接对「输出的动作对不对」负责,语言指令与视觉观测在同一个表征空间里共同决定动作——规划模块不再是规则写的。

2. 为什么动作多用 chunk 而不是单步? 单步预测会累积漂移且推理频率被控制环绑架;chunk 让一次推理覆盖一段未来,天然带时序一致性,还能降低推理开销。代价是开环执行期间对突发扰动反应迟钝。

3. Diffusion Policy 和回归式动作头各自适合什么? 回归头快但对多模态动作分布(同一状态有多种合理走法)会取平均输出「什么都不像」的动作;扩散/流匹配能表达多峰分布,代价是推理步数与延迟。

4. Sim2Real 三大鸿沟来源与三板斧? 视觉差/动力学差/观测差 → 域随机化、系统辨识、域适应。真机掉点排查先查标定与视角,再查接触摩擦,最后查延迟对齐。

5. 世界模型「物理接地」不够会怎样? 生成的视频看着真但违反接触与稳定性,用它评策略会系统性高估策略质量——推演评测必须先在真实 rollout 上做一致性校准。

6. BC 的分布漂移是什么、DAgger 怎么解? 策略偏离训练分布后进入没见过的状态、错误越滚越大;DAgger 让策略在环中行动、专家对它自己的状态标注纠正动作、把纠正数据回灌再训。

7. GRPO 用在具身上和用在自驾上有什么不同? 奖励更稀疏(成/败 0-1)、rollout 更贵(真机不能无限试错,常用仿真代理)、且要处理动作分布约束——所以往往只在微调阶段用,且要配安全层。

8. 跨本体数据怎么一起训? 本体标记(embodiment token)、统一动作空间(如都映射到末端 6D)、动作分词器共享——本质是给不同「身体」做条件化,让一个策略头学会读身体说明书。

9. 「物理-语义割裂」指什么?(方奇考题) 世界模型擅长物理延续但缺人类任务常识(为什么这样摆),具身大脑擅长语言任务推理但缺物理直觉(这样拿会滑);语义化世界模型的思路是把两者统一到三维语义空间里联合建模。

10. 你的自驾背景三个月后最能贡献什么? 不是「会用 Transformer」,而是被路测毒打出来的工程制度:数据归因闭环、开/闭环评测纪律、后训练配方经验、部署实时性直觉——这四样在具身团队里都还是稀缺品。


结语

具身智能不是自动驾驶的「远房亲戚」,它是同一场「学习型控制」革命换了一具身体。你带来的端到端直觉、流匹配手感、RL 后训练经验与数据闭环方法论,就是这场迁移里的硬通货;要补的,是那两层「硬」功夫——本体与控制——和对动作空间的敬畏。

接下来:按第五部分的 8 周计划走,每周回到这篇文章对照进度;读论文优先走第四部分地图,能用站内精读省下的时间全部砸到动手上。八周之后,当你站在面试官面前,你不是「转行的自驾工程师」,而是**「做过世界模型和后训练、现在来补机器人那半边的人」**。

祝顺利。🚀