写在前面:这篇文章为谁而写
我自己从自动驾驶转向具身智能方向,这篇文章就是我的入职前学习总纲——把我查过的公开资料、读过的论文、站内已有的 100+ 篇文章,整理成一条可以从头走到尾的路径。你有三个别人没有的起点:
- 你做过端到端:UniAD/VAD/DiffusionDrive 这套「感知直连规划」的直觉,正是 VLA 的骨架;
- 你做过世界模型 + Flow Matching 动作专家:这是 2026 年具身最热的两条技术线的正中心;
- 你做过 GRPO/Flow-GRPO 后训练:具身策略的后训练配方和你在自动驾驶上调过的几乎同源。
所以这篇文章不教你「什么是 Transformer」,它解决的是:怎么把自驾的存量能力,快速折算成具身的战斗力,并补齐那几块真正新的课。
全文八部分:
① 大图景 具身智能是什么 + 2026 行业坐标 + 方奇科技怎么读
② 迁移地图 自动驾驶九项能力 → 具身对应物(+ 五个不能搬的差异)
③ 知识栈 八块要学的:机器人学 / 模仿学习 / VLA / 仿真 / 世界模型 / 数据 / RL / 系统
④ 论文地图 30+ 篇分层必读,每篇一句「解决什么」+ 站内精读链接
⑤ 动手计划 8 周:从跑通 LeRobot demo 到复现 VLA + RL 后训练
⑥ 定向准备 方奇科技的技术主张与面试高频题
⑦ 资源清单 站内索引 + 外部仓库 / 基准 / 关注列表
⑧ 自测 Q&A 10 道题检验「真的入门了吗」
一、大图景:具身智能到底是什么
1.1 一句话定义
具身智能(Embodied AI)= 智能体通过「身体」在物理世界里感知、决策、行动,形成闭环。 与之相对的是「离身智能」——ChatGPT 这类系统输入输出都是数字信号,错了可以撤回;机器人推倒了杯子,杯子就碎了。这个差异决定了具身智能的全部技术形态:必须处理不确定性、必须在环、必须为失败付出真实代价。
这条线的思想源头可以追到图灵 1950 年代的设想,中间经历行为主义机器人、深度强化学习(AlphaGo/机械狗)、大模型三个浪头,到 2025-2026 年才因为「VLM/VLA 成熟 + 资本涌入」真正爆发。中国人工智能学会的《具身智能白皮书(2026)》把核心技术归纳为:感知、推理、操作、导航、交互的闭环,其中具身大模型(VLA、WAM 范式)是核心,虚实结合(仿真/世界模型)是重要方向。
1.2 任务谱系:先知道自己进的是哪个坑
| 方向 | 干什么 | 代表系统 | 数据/评测特点 |
|---|---|---|---|
| 操作(Manipulation) | 手臂/双臂抓取、放置、装配、工具使用 | π0、OpenVLA、RDT、ALOHA | 本文主战场,方奇的「立体清洁」属于此类延伸 |
| 导航(Navigation) | 移动、避障、语义寻址 | 扫地机器人、配送机器人 | 和自驾最像,但地图是室内语义级的 |
| 人形(Humanoid) | 双足全身控制 + 操作 | Figure、宇树、智元 | 本体最难,大脑往往外挂 VLA |
| 多机协作 | 群体分工、人机共融 | 工厂集群、编队 | 前沿,先了解即可 |
入门 80% 的精力应放在「操作」上:它是 VLA 论文的主战场、数据集最全、评测最成熟,也是大多数大脑公司的核心场景。
1.3 技术栈:一座六层大厦
从下往上读:
- L1 本体硬件:人形/双臂/轮式本体、关节电机、夹爪还是灵巧手、相机/力矩/触觉传感器——这一层是「具身」的字面意思,也是自动驾驶完全没有的对象;
- L2 运动控制「小脑」:正逆运动学、雅可比、阻抗与力控、千赫兹级实时控制环——自驾最该补的一层:车是「你给轨迹我跟上」,机械臂是「你给末端位姿我要解算几十个关节怎么转、碰到东西该软还是该硬」;
- L3 智能「大脑」:VLA、世界模型/WAM、VLM 推理、RL 后训练——资本最密集的一层(2026 上半年具身融资超一半流向「大脑派」,其中 VLA 占 42%、世界模型占 27%、数据基础设施占 20%,本体厂商只拿到不到 20%);
- L4 数据引擎:遥操作采集、人类视频、Real2Sim 合成、失败归因采数——行业的「卡脖子」层(下文 1.4);
- L5 仿真与评测:Isaac Lab/MuJoCo、Sim2Real 鸿沟、LIBERO/RoboCasa、开环 vs 闭环;
- L6 系统与部署:ROS2、推理加速、安全熔断、云端大脑 + 端侧小脑。
你的迁移画像:L3L6 的方法论基本可迁移(端到端、扩散/Flow、GRPO、世界模型直觉、数据闭环、评测回归、部署加速),L1L2 和 L3 里的「动作空间」是全新课。蓝色区是你带过去的本钱,黄色区是入职前要补的账。
1.4 2026 行业坐标:三个必须知道的数字
- 钱往哪流:2026 上半年具身融资总额 1041 亿元,超过 2025 全年近一倍;结构上是「重大脑、轻本体」——VLA 42%、世界模型 27%、数据 20%。这意味着算法岗(大脑)是行业主战场,你赶的时机是对的。
- 数据缺口 99%:VLA 要达到通用自主,量级估计需要千万小时级高质量真实交互数据;截至 2026 年初全球合规可用的机器人数据只有约 50 万小时。和自驾「数据靠车队滚雪球」不同,机器人没有车队——所以 Real2Sim、人类视频、仿真合成、失败归因这些「造数据」的技术才这么卷。
- 量产 ≠ 落地:2026 年人形机器人整机产量有望破 10 万台(2025 约 2 万台),宇树科创板 IPO 获批;但大量出货仍在科研教育场景,工业/商业落地刚起步。行业共识从「能走能跳」转向「能想会决策」——这正是大脑公司的机会窗口。
还有一个来自业界的判断框架值得记:一个领域要爆发,需要三次可规模化的范式突破——可规模化预训练、可规模化对齐、可规模化商业化部署(LLM、自动驾驶都走完了这三步)。VLA/世界模型目前处在第一步的中段、第二步的早期。面试聊「你怎么看行业阶段」,这套框架比背融资数字高级得多。
1.5 方奇科技怎么读:你的下一站(基于公开报道整理)
以下全部来自公开报道(2026-09-21 融资新闻、北京日报、机器人大讲堂、金融界等),入职后以内部信息为准。
基本盘:方奇科技(北京)有限公司,2026 年 2 月成立,北京海淀,定位「具身智能通用大脑研发企业」;成立 7 个月即完成千万级天使轮(启迪之星创投等)。创始人王心舟,1996 年生,本硕北京航空航天大学、博士师从清华大学计算机系孙富春教授,深耕具身智能、三维视觉与多模态生成大模型,创业前参与腾讯混元 3D 模型与物理 AI 算法架构设计;团队核心均来自清华大学,覆盖世界模型、VLA 算法、云原生系统与商业化全链路。
技术主张(这是面试最可能被深挖的部分):
| 主张 | 内容 | 对应你需要准备的知识 |
|---|---|---|
| 问题诊断 | 泛化弱的根因 = 世界模型缺乏人类知识,具身大脑缺乏物理常识,即物理知识与语义知识的割裂 | 世界模型 vs VLA 的能力边界(你有驾驶世界模型经验,直接能聊) |
| 语义化世界模型 | 把具身大模型与世界模型深度耦合,将视觉、语言、物理状态组织到统一的三维语义空间 | 三维表征、多模态对齐、WorldArena 类评测(Ctrl-World 是 2026 年的标杆) |
| 图灵学习范式 | 课程学习 → 任务学习 → 实践学习 → 反思学习的链路,打破传统遥操「只知其然」,让机器人从人类数据与真实实践中持续学习 | 模仿学习的局限、自我改进/RSI 论文(站内 Zetta/EmbodiRSI 精读) |
| 架构路线 | 云端大脑(多模态大模型)+ 端侧小脑 + 实时孪生世界模型(中间件),本体无关、跨本体复用 | 云边协同、模型蒸馏、跨本体动作空间归一化 |
| 产品叙事 | 沉淀「通用技能操作系统」:具身能力的学习、沉淀、分发基础设施;以立体清洁为首个商业化练兵场 | 技能库抽象(Voyager/ROCKET 系)、场景闭环 |
| 进化飞轮 | 图灵学习 × 语义化世界模型 = 云原生具身大脑的成长飞轮 | 数据闭环 + 世界模型仿真 + RL 后训练的组合 |
一句话把它放进你的知识地图:方奇做的是「VLA 与世界模型的耦合层」——你自驾做的 Cosmos/WAM 类工作(预测 state+action 联合分布)正是这个方向的近亲,这是你面试时最值钱的一句话:「我在车上做的世界动作模型,和贵司语义化世界模型要解决的物理-语义割裂,是同一个问题的两种参数化。」
1.6 术语表(先混个脸熟,后文直接用)
| 术语 | 含义 |
|---|---|
| VLA | Vision-Language-Action:图像+语言 → 动作的端到端策略 |
| WAM | World Action Model:联合预测 state + action 的「世界-动作模型」 |
| 本体 / Embodiment | 机器人的物理身体形态(双臂、夹爪、灵巧手…) |
| 自由度 DoF | 独立可控的关节数,14-DoF 双臂 = 每臂 7 轴 |
| 末端 / EEF | End-Effector,夹爪尖那一点的位姿 |
| 遥操作 Teleoperation | 人远程控制机器人采集示教数据 |
| 动作块 Chunk | 一次输出未来 10~100 步动作,而非单步 |
| 示教 / Demonstration | 一条「怎么做对」的示范轨迹 |
| Sim2Real | 仿真里训练、真机上部署的迁移 |
| 域随机化 | 训练时随机化物理/视觉参数以缩小仿真-真机差距 |
| IL / BC | 模仿学习 / 行为克隆:照着示教抄动作 |
| DAgger | 让策略自己犯错、专家现场纠正、数据回灌的迭代算法 |
| RSI | Recursive Self-Improvement,递归自我改进 |
二、迁移地图:自动驾驶的存量怎么折算
九项能力逐条说(左列自驾、右列具身,差异在括号里):
- BEV/3D 感知 → 工作空间理解:从「道路上的车流占据」换成「桌面上的物体 6D 位姿、支撑关系、可操作性」。相机配置也变了:头顶相机 + 双腕部相机的近距离、大畸变、自遮挡视角。(自驾靠 LiDAR+BEV 深度先验,具身多数只有 RGB,深度靠学习或双目。)
- 轨迹规划 → 动作块:自驾输出 3 秒
8 秒的轨迹点(10Hz 级);具身输出未来 10100 步的关节/末端动作块(50Hz 级),且是序列生成问题(扩散/流匹配很吃香)而非回归问题。 - 端到端 UniAD/VAD → VLA:骨架完全同构——「一个网络从观测直出控制」。差别是自驾的输出是轨迹、目标函数是舒适与安全;VLA 的输出是动作、目标函数是任务完成,而且多了一个语言输入(指令改变了动作的语义)。
- 扩散/Flow Matching 规划器 → Diffusion Policy / 动作专家:这是你最值钱的技能之一。π0 的 flow matching 动作专家、RDT 的扩散双臂策略,和你在车上做的轨迹分布建模是同一套数学——只是把「道路可行驶域」换成「关节构型空间」。
- GRPO/RLHF 后训练 → 机器人 RL:reward 从「碰撞/舒适/合规」变成「任务成功 + 接触惩罚」;站内 Flow-GRPO 完整指南 的方法论直接平移,新概念是 DAgger(专家在环纠正)与 RSI(失败驱动的递归自改进)。
- 驾驶世界模型 → 具身世界模型:你做 MOT/Cosmos 类「预测未来观测/状态」的直觉完全适用;具身的升级点是必须把 action 纳入联合预测(做这个动作世界会怎样),并要保住接触、稳定、力这些控制相关变量——这正是方奇「物理-语义割裂」议题的技术腹地。
- 数据闭环/长尾挖掘 → 失败归因采数:自驾是「从路采里挖难例」;具身是「从 rollout 里归因失败格子,把示教定向砸向弱点」(EmbodiRSI 的 ADC 就是这套)。
- 开环/闭环评测 → 仿真基准 + 真机试验:NAVSIM 的「指标体系 + 回归检测」方法论照搬;对象换成 LIBERO/RoboCasa 的成功率、以及真机 10 次试验的均值±方差。记住具身的两条铁律:训练时开环误差低没用,闭环成功率才算数;测试时必须关掉所有辅助(agent 接管/人工纠正)。
- 车端部署 → ROS2 + 端侧小脑:部署直觉(量化、算子、延迟预算)通用;新增 ROS2 通信栈与「云端大脑低频决策、端侧小脑高频执行」的分层。
五个不能直接搬的差异(面试必聊,也必踩的坑)
| # | 自驾 | 具身 | 后果 |
|---|---|---|---|
| 1 | 数据海量:车队每天百万公里 | 数据稀缺:真机遥操作一小时产几分钟有效数据 | 不能迷信 scaling,要靠仿真合成与数据配比 |
| 2 | 接触稀少:主要与地面滚动接触 | 接触是任务本身:抓、插、拧全是接触动力学 | 亚厘米误差就失败;力/触觉信号地位大增 |
| 3 | 控制分层清晰:10Hz 规划、底盘执行 | 频率耦合:策略 50Hz 出动作,底层 1kHz 控制 | 动作表征(绝对/相对/delta)选错直接训崩 |
| 4 | 不可重置:一次路采就一次 | 可重置:仿真里同一个初始状态试一千次 | 评测协议完全不同(固定种子 vs 分布采样) |
| 5 | 安全兜底成熟:规则兜底+冗余 | 安全体系刚起步:熔断+物理限位+人机隔离 | 安全模块是新岗位机会(可复用你的功能安全经验) |
你的三个项目怎么翻译成具身语言
站内 三大项目面试全书 里的项目,面试时这样「转译」:
- RiskField-VLA(风险场 VLA) → 「我做过语言条件化的风险代价函数嫁接到端到端策略,对应具身里『安全约束进 VLA』——接触安全、可恢复性约束是同一个问题的物理版」;
- TrustDrive-WAM(世界动作模型) → 「我做过state+action 联合预测的世界动作模型,与贵司语义化世界模型要打通的物理-语义割裂是同构问题;差异在我那边重长时序预测,机器人这边重接触与因果」;
- JEPA-DRIVE → 「我做过在潜空间预测未来表征而非像素,对应具身世界模型里『表征学习 vs 像素渲染』的路线之争(JEPA vs 视频生成),我知道哪类任务各自划算」。
三、知识栈:八块要学的东西(每块给「为什么 + 学什么 + 自检标准」)
A. 机器人学基础(薄薄一层,但必须有)
为什么:不理解正逆运动学,看不懂动作空间;不理解阻抗控制,不明白为什么「位置控制的机械臂碰到桌子会抖」。
学什么(两周内用到什么学什么,不必啃完整本教材):
- 刚体变换与坐标系(SE(3)、齐次变换)——你做 BEV 标定时已会一半;
- 正运动学(DH 参数)与逆运动学:给定夹爪位姿求关节角(解析解/数值解);
- 雅可比矩阵:关节速度 ↔ 末端速度的换算,奇异点是什么;
- 阻抗/导纳控制:为什么抓鸡蛋要「软」、插轴孔要「顺从」——具身论文里 compliance 是高频词;
- 夹爪(二指/吸盘)vs 灵巧手(多指)的控制差异;
- 手眼标定(相机-末端外参)——对标你的相机成像与标定经验。
学法:不用报课,直接看 modern-robotics 教材对应章节 + LeRobot 文档里的 action space 部分,动手在仿真里把「末端画 8 字」跑通。
自检:能回答「为什么 VLA 输出经常用相对位姿(delta)而不是绝对关节角?」
B. 模仿学习与操作数据的基本功
为什么:具身 90% 的落地模型是模仿学习产物;不懂数据怎么来、怎么标,模型代码读不懂。
学什么:
- IL vs RL:行为克隆(BC)的分布漂移问题;DAgger 如何用「专家纠正」解决它;
- 动作表示四件套:关节角 / 末端位姿(6D) / 相对增量 / 速度指令——不同数据集用不同表示,读论文先看这个;
- 动作块(action chunking)与时间编码:为什么一次预测一整段(抑制漂移、降推理频率);
- 遥操作方案:ALOHA(双臂主从)、GELLO、VR 手柄、动捕手套——数据从哪来的感性认识;
- 两条基线算法吃透:ACT(Transformer + CVAE 逐 token 出动作块)与 Diffusion Policy(扩散去噪生成动作序列)——它们是后续所有 VLA 动作头的「Hello World」;
- 数据集格式:RLDS(谷歌系)、LeRobot parquet(社区系)的 episode 结构。
学法:站内 Diffusion-Policy 精读 + ACT-ALOHA 精读 + DiffusionPolicy 代码讲解;数据集看 DROID 精读 与 Open-X-Embodiment 精读。
自检:给你一条 episode,能说出哪列是观测、哪列是动作、动作块长度多少、坐标系是哪个。
C. VLA 深水区(你的主攻方向)
为什么:这是大脑公司的核心岗,也是面试 60% 的考点。
必须搞清的四条线:
- 族谱线:RT-1(离散动作 token)→ RT-2(把动作当文本输出,VLA 概念成型)→ OpenVLA(开源 7B 底座)→ π0(VLM + flow matching 动作专家,高频动作输出的工业标杆) → GR00T N1.5(人形,双系统快慢脑)→ Qwen-VLA/RDT(中文生态与双臂)→ 2026 前沿(π0.7、τ0-VLA 等)。
- 架构线:视觉编码器(ViT/DINOv2)+ VLM 主干(冻结/LoRA)+ 动作头三选一:离散 token(分类损失)、扩散/流匹配(去噪损失,你的主场)、自回归连续(回归损失)——各自的延迟/精度/多模态性 trade-off 要能背。
- 训练配方线:动作数据与图文数据混合预训练(防 VLM 退化)、**重采样(resampling)**平衡长尾任务、动作归一化、chunk 长度与推理频率的关系、共训(co-training)配比——这些「炼丹细节」在 VLA 大模型训练技巧 有系统总结。
- 评测线:LIBERO 四套设置(Spatial/Object/Goal/10)、RoboCasa、真机评测协议;开环 MSE 为什么不可信(站内 开环评测vs闭环评测)。
学法:先读 什么是VLA模型 建立骨架 → 前沿VLA模型全景速览 看族谱 → 精读 π0(有配套 π0 代码讲解)与 RDT与RDT2精读 → 训练配方读 VLA 大模型训练技巧。
自检:能白板画出 π0 的前向路径,并解释「为什么动作专家要用 flow matching 而不是直接回归?」
D. 仿真与 Sim2Real
为什么:真机贵、慢、危险,仿真训练是具身的「路测」;同时具身最独特的失败模式(仿真里 90%、真机 40%)全在这层。
学什么:
- 三大仿真器定位:Isaac Lab(GPU 并行、大规模 RL)、MuJoCo(接触物理准、学术经典)、ManiSkill/SAPIEN(操作任务库)——知道各自生态即可;
- Sim2Real 鸿沟的三大来源:视觉差(渲染 vs 真实)、动力学差(摩擦/质量/延迟)、观测差(相机噪声/标定);对应三板斧:域随机化、系统辨识、域适应;
- 评测协议:固定种子 vs 随机种子、开发集与留出集隔离、成功率±方差报告——读 Zetta 与 EmbodiRSI 精读 时注意它们防「评测污染」的制度设计;
- 基准扫盲:LIBERO、RoboCasa、SimplerEnv、CALVIN、RLBench(按常用度排)。
自检:「仿真成功率 90% 真机只有 50%,按优先级列出你会先查哪三个原因?」(答案常排前三位:相机视角/标定、接触摩擦、动作延迟对齐。)
E. 世界模型(你最顺手的一块,但要换战场)
为什么:方奇的核心主张之一;也是 2026 年资本第二流向(27%);更是你自驾经验最容易兑现的地方。
先统一定义:世界模型 = 对「给定状态与动作,世界下一步会怎样」的可学习建模,三件套是表征(state 表示)+ 动力学(转移预测)+ 推演(rollout 规划/评测)。做自动驾驶的你习惯叫它「驾驶世界模型」,具身的行话有几个变体:
| 变体 | 与你熟悉的对应物 | 关键差异 |
|---|---|---|
| 视频世界模型(Genie/UniSim/Cosmos 系) | Cosmos 世界基础模型 | 具身版要动作可控(action-conditioned),否则没法做策略推演 |
| WAM 世界动作模型 | 你的 TrustDrive-WAM | 状态+动作联合预测,落地三用途:推演评测、数据合成、RL 环境 |
| 潜在/表征世界模型(Dreamer/JEPA 系) | 你的 JEPA-DRIVE | 在潜空间想象,避开像素重建的算力与伪影 |
| 语义化世界模型(方奇主张) | —— | 把物理状态与语言/语义统一到三维语义空间,解决「物理-语义割裂」 |
学什么:先读 什么是世界模型 打底 → 驾驶世界模型全景详解 复习你的主场 → DreamerV3 精读 与 UniSim 精读 补两条路线 → GigaWorld-0 精读 与 Cosmos3 精读 看 2026 工业级做法 → 最后读 Zetta 与 EmbodiRSI 精读 看世界模型如何与递归自改进(RSI)结合。
具身世界模型特有的三个考点:
- 推演评测(rollout-based eval):用世界模型代替部分真机试验来评策略——方奇/EmbodiRSI 这类「仿真-数据-评测」闭环都在这条线上;
- 物理接地:光会生成好看的视频不算世界模型,要能预测接触、稳定性、力——这也是 Motis 类立场论文(2026)对当前世界模型「物理与语义割裂」的批评;
- 与 VLA 的关系:三条路线要能讲清——世界模型服务 VLA(做推演/数据/RL 环境)、世界模型内化进 VLA(WAM 一体)、世界模型主导 VLA(想象中规划)。方奇的「耦合」主张属于二三之间。
自检:「同一个任务,用世界模型评策略和真机实测,结果不一致你会怎么查?」(模型偏差、分布外状态、奖励代理与真实目标不对齐……能列三层就达标。)
F. 数据工程(行业卡脖子处,也是自驾人最能降维的地方)
为什么:数据缺口 99% 意味着谁会造数据谁就有护城河;你在自驾做的是「路采→归因→挖掘→回灌」,这套方法论在具身是稀缺能力。
学什么:
- 数据来源金字塔:真机遥操作(质量高、贵)> 真机自主探索 > 人类视频(YouTube/EPIC,便宜但无动作标签)> 仿真合成(Real2Sim/大规模渲染)> 世界模型生成(质量存疑,需验证);
- 主流数据集地图:Open-X-Embodiment(22 种本体 100 万+ 轨迹)、DROID(564 场景 76k 轨迹)、BridgeData、RH20T、LIBERO——各自的本体、指令分布、动作空间(站内均有精读);
- 核心矛盾:跨本体——不同机器人的 DoF 不同、动作空间不同,怎么归一化训练(本体标记 embodiment token、统一到末端空间、动作分词器)——这直接对应方奇「本体无关」的产品主张;
- 数据配比与归因采数:任务间/本体间/图文-动作数据的配比;失败格子定向补采——你的数据闭环经验直接平移(数据闭环工程)。
自检:「新场景只有 20 条真机示教,怎么把它放大成能训练 VLA 的数据集?」(仿真增广 + 语言改写 + 世界模型 rollout 筛选 + 远程协作补采,答出组合拳即可。)
G. RL 与后训练(你的第二主场)
为什么:模仿学习封顶在「示范者水平」,超过示范者只能靠 RL;而 2026 年具身后训练的主流正是你用过的 GRPO 家族。
学什么:
- 基础补缺:强化学习基础详解、离线强化学习详解(离线 RL 对机器人很关键——真机不能无限试错);
- 主线:SFT(模仿)→ RL 微调的配方;奖励设计(任务成功 0/1 + 接触/能耗塑形);GRPO 方法 → Flow-GRPO 详解(扩散/流匹配策略的 RL,站内有完整指南);
- 机器人特有算法:DAgger(专家纠正回灌)、RFT/DPO 变体(按偏好筛轨迹)、RSI 递归自改进(失败→归因→补数据→再训的飞轮,Zetta 与 EmbodiRSI 是 2026 的两篇代表作);
- 关键 trade-off:RL 训练在仿真还是真机?(真机 RL 需要安全层 + 世界模型做代理环境——又回到你的主场)。
自检:「Behavior Cloning 学到 85% 成功率,剩下 15% 怎么办?」(DAgger 纠错 + RL 稀疏奖励 + 针对性补采,三段式回答。)
H. 系统与部署(入门够用即可,别陷进去)
学什么:ROS2 话题/服务/TF 树的基本盘(ROS2 入门);实时性预算(策略 50Hz 出块、底层 1kHz 闭环);云端大脑(低频推理)+ 端侧小脑(高频执行)的分层部署——这正是方奇「云原生具身大脑」的架构叙事;模型侧的量化/蒸馏经验直接沿用自驾。
自检:「VLA 推理一次 100ms,但控制环要求 50Hz,你怎么设计?」(动作块 + 异步推理 + 端侧插补,你部署过的直觉直接适用。)
四、论文地图:30+ 篇怎么排优先级
规则:L0~L2 必读(约 15 篇,配合站内精读 2
3 天可扫完),L3L5 按方向选读,L6 综述扫目录。标 ⭐ 的是站内有全文精读/代码讲解的。
L0 · 概念奠基(4 篇,知道「VLA 从哪来」)
| 论文 | 一句「解决什么」 | 站内 |
|---|---|---|
| SayCan | 语言模型选「最有用的行为」——给 LLM 装上「能做什么」的身体约束 | 精读 |
| PaLM-E | 多模态大模型进机器人:图像+语言+状态统一大脑 | 精读 |
| RT-1 | Transformer 直接从图像出动作 token,证明可规模预训练 | 精读 |
| RT-2 | VLA 概念成型:把动作当「文本」输出,复用 VLM 全部常识 | 精读 |
L1 · 操作基础(4 篇,动作头的「Hello World」)
| 论文 | 一句「解决什么」 | 站内 |
|---|---|---|
| Diffusion Policy ⭐ | 扩散模型生成动作序列,解决多模态动作分布 | 精读 + 代码 |
| ACT(ALOHA) ⭐ | CVAE + Transformer 出动作块,低资源双臂学习 | 精读 |
| Gato | 一个网络玩所有模态,通用智能体雏形 | 精读 |
| EmbodiedGPT | 具身思维链:CoT 让机器人任务分解可解释 | 精读 |
L2 · 现代 VLA 主干(6 篇,面试主战场)
| 论文 | 一句「解决什么」 | 站内 |
|---|---|---|
| OpenVLA ⭐ | 开源 7B VLA 基线,离散动作 token 路线 | 精读 |
| π0 / π0.5 ⭐ | flow matching 动作专家——高频连续动作的工业标杆,与你 Flow Matching 经验同源 | 精读 + 代码 |
| RDT / RDT-2 ⭐ | 双臂 16-DoF 扩散基线,动作空间扩到全身 | 精读 |
| Octo | 可微调的开源通用策略,LoRA 式适配 | 精读 |
| GR00T N1.5 | 人形双系统「快脑/慢脑」,NVIDIA 数据引擎打法 | 在 全景速览 中覆盖 |
| VLA 安全综述 ⭐ | VLA 的安全威胁分类——具身安全岗的入场券 | 精读 |
L3 · 数据与基准(4 篇,聊「数据从哪来」的底气)
- Open-X-Embodiment ⭐(精读)——跨本体数据集的「ImageNet 时刻」;
- DROID ⭐(精读)——真实家居分布、可泛化性标杆;
- RH20T(精读)——拟人双臂 + 传感器全模态;
- LIBERO(精读)——事实上的 VLA 开发基准四件套。
L4 · 世界模型线(5 篇,你的主场延伸)
- DreamerV3(精读)——「在想象里练出真本事」的奠基;
- UniSim(精读)——交互式模拟器路线;
- Cosmos-3(精读)——工业级世界基础模型 + 你熟悉的后训练组合;
- GigaWorld-0(精读)——数据引擎路线;
- GigaWorld-1 / WMBench(arXiv 2607.02642,2026)——从「建世界模型」转向「用世界模型评策略」的基准与路线图,正好接在你 TrustDrive-WAM 的延长线上。
L5 · 2026 前沿(6 篇,追热点用)
| 方向 | 论文 | 看点 |
|---|---|---|
| RSI 递归自改进 | Zetta(精读) | Agent Harness 驱动的 L1→L5 自我改进体系 |
| RSI 落地闭环 | EmbodiRSI(同上文) | Real2Sim2Real + 失败归因采数的完整制度 |
| 测试时计算 | τ0-VLA(arXiv 2608.16885) | 分层机器人基础模型 + 世界模型引导的 test-time search |
| 世界模型基准 | GigaWorld-1/WMBench(见上) | 世界模型作为策略评测器 |
| 通用底座 | π0.7(2026) | 可引导的通用机器人基础模型、涌现能力 |
| 立场与批评 | Motis 系立场论文(arXiv 2606.06556) | 指出四个缺失组件:物理数据引擎、跨本体任务保留、物理接地世界模型、自我改进部署循环——直接呼应方奇的「物理-语义割裂」判断 |
L6 · 综述扫目录(3 篇,快速建地图)
- 《Embodied AI: From LLMs to World Models》(arXiv 2509.20021,清华/复旦系)——LLM→VLA→世界模型的演进主轴;
- 《World Models for Embodied AI》(arXiv 2510.16732)——世界模型在具身的系统分类;
- 中国人工智能学会《具身智能白皮书(2026)》——中文体系 + 产业政策视角,面试聊「行业怎么看」的语料库。
站内还有这些顺路读:lerobot 开源框架、前沿VLA模型全景速览、VLA vs 感知之争——完整的 具身智能 分类索引见第七部分。
五、动手计划:8 周从「读过」到「跑过」
原则:每周必须有可运行的产出(notebook/脚本/对比表),读论文不产生肌肉记忆。以下默认你入职前有完整 8 周;时间紧就压缩成「4+4」(第 1-2 周并入第 3-4 周)。
第 1-2 周 · 地图周:环境 + 数据体感
| 任务 | 交付物 |
|---|---|
| 装好 LeRobot(模拟器 + 预训练 checkpoint),跑通 SO100/ALOHA 模拟臂 demo | 屏幕录像 + 环境文档 |
| 下载一条 Open-X 或 DROID episode,可视化观测与动作序列 | 可视化 notebook:episode 结构图 |
| 读 L0 全部 4 篇 + 站内 什么是VLA、什么是世界模型 | 一页纸族谱:RT-1→RT-2→OpenVLA→π0 |
| 手推一遍「正运动学→逆运动学」,在仿真里让末端画 8 字 | 30 行脚本 |
第 3-4 周 · 基线周:亲手训一个
| 任务 | 交付物 |
|---|---|
| 在 LIBERO(或 SimplerEnv)上复现 Diffusion Policy 或 ACT 训练 | 训练曲线 + 成功率表 |
| 用 LeRobot 微调一个 OpenVLA/π0 checkpoint 到新指令分布 | 微调前后成功率对比 |
| 消融一个训练配方旋钮:action chunk 长度 / 重采样 / 归一化 | 300 字结论:哪个最敏感 |
| 读 L1+L2 主干 8 篇(用站内精读省一半时间) | 面试用白板图:π0 前向路径 |
第 5-6 周 · 世界模型周:把主场变成武器
| 任务 | 交付物 |
|---|---|
| 跑通一个 action-conditioned 世界模型 rollout,做一次「虚拟评测 vs 真实/仿真评测」对照 | 一致性分析表:哪里不可信 |
| 把你 TrustDrive-WAM 的经验写成一页「自驾 WAM → 具身 WAM」的迁移备忘 | 一页纸(面试直接用) |
| 读 L4 世界模型 5 篇 + Zetta/EmbodiRSI 精读 | RSI 飞轮手绘图:失败→归因→补采→再训 |
第 7-8 周 · 后训练周:RL + 查漏 + 面试弹药
| 任务 | 交付物 |
|---|---|
| 用 GRPO/Flow-GRPO(站内完整指南)在小任务上做一次策略 RL 微调 | 成功率提升曲线 + reward 设计笔记 |
| 实现或跑通一次 DAgger:让策略犯错、专家纠正、回灌再训 | 「BC 封顶问题」的实证数据 |
| L5 前沿 6 篇扫读 + 方奇全部公开资料整理 | 面试问题清单 20 条(带自己的答案) |
| 三大项目按 面试全书 的「自驾→具身转译」口述 3 遍 | 3 分钟第一人称录音 ×3 |
每天节奏建议:上午 2h 动手(别碰手机),下午 1.5h 论文 + 站内精读,晚上 0.5h 把当天结论写进求职笔记。第 2 周起每周至少一次「假设入职被问 X」的模拟回答。
六、定向准备:面向方奇科技的面试弹药
基于公开报道整理,入职后以内部为准。
6.1 必须能讲的五个问题
- 「世界模型和 VLA 是什么关系?」——用三条路线回答(服务型/一体型/主导型),落点在「贵司的语义化世界模型是把两者在三维语义空间里耦合,解决物理知识与语义知识割裂」。
- 「你怎么理解图灵学习范式?」——课程→任务→实践→反思四段链路;对比遥操作示范「只知其然」的局限;接上你做过的「失败归因→定向补采」闭环。
- 「数据从哪来?」——金字塔(遥操作/人类视频/仿真/Real2Sim/世界模型生成)+ 跨本体归一化 + 99% 缺口的行业背景。
- 「自驾经验对你有什么用?」——直接用第二部分的九项迁移表 + 五个差异(讲差异比讲迁移更能体现你真懂)。
- 「立体清洁为什么能先落地?」——结构化、可验收、容错高、数据可沉淀;这是「练兵场」而非「终点」的商业逻辑。
6.2 你比纯具身候选人多的五张牌
- Flow Matching 动作专家:π0 系工业标杆的底层数学你在车上就写过;
- WAM 世界动作模型:state+action 联合预测的第一手经验,直接对话「语义化世界模型」;
- GRPO/Flow-GRPO 后训练:具身后训练主流配方的完整工程链路;
- 数据闭环方法论:具身最缺的「归因-采数-回灌」组织能力;
- 开/闭环评测与回归制度:具身评测还很草莽,你的 NAVSIM 类经验是降维。
6.3 反问清单(面试尾声用,选 2~3 个)
- 语义化世界模型目前的评测方式是什么?世界模型 rollout 在多大程度上替代了真机试验?
- 团队的动作数据以遥操作为主还是以仿真/Real2Sim 为主?跨本体的归一化方案定型了吗?
- 图灵学习范式里「反思学习」的信号来自哪——自动失败检测、人工标注还是世界模型 critic?
- 云端大脑与端侧小脑的职责切分线在哪?端侧跑的是蒸馏后的策略还是原模型?
- 第一个商业化场景(立体清洁)的数据飞轮已经转起来了吗?闭环里最难的一环是什么?
七、资源清单
7.1 站内索引(按阅读顺序)
入门四件套:什么是VLA模型 → 什么是世界模型 → 前沿VLA模型全景速览 → VLM视觉语言模型入门详解
技术深水区:VLA大模型训练技巧 · 驾驶世界模型全景详解 · Flow-Matching入门详解 · Flow Matching与扩散模型统一视角 · 扩散模型基础详解 · GRPO强化学习方法详解 · Flow-GRPO详解 · 离线强化学习详解 · JEPA联合嵌入预测架构详解
工程与评测:ROS2入门 · 数据闭环工程 · 开环评测vs闭环评测深度解析 · 仿真器搭建与闭环测试
论文精读(具身智能分类精华):π0 · OpenVLA · RDT与RDT2 · Diffusion Policy · ACT-ALOHA · DROID · Open-X · LIBERO · Octo · RT-1 · RT-2 · SayCan · PaLM-E · Gato · Zetta与EmbodiRSI · DreamerV3 · UniSim · Cosmos3 · GigaWorld-0 · VLA安全综述——链接见第四部分论文地图。
代码讲解:π0代码 · DiffusionPolicy代码 · AutoVLA代码
面试与规划:三大项目面试全书 · Flow-GRPO完整指南 · 自动驾驶学习路径 · VLA与感知之争
7.2 外部资源
- 动手框架:LeRobot(首选,文档友好)· OpenVLA · openpi(Physical Intelligence π0 开源栈)· Isaac Lab · ManiSkill
- 数据集门户:Open-X(RLDS 格式样例最多)· DROID · LIBERO
- 跟踪前沿:arXiv 的
cs.RO+cs.LG交叉、Hugging Face Daily Papers 的 robotics 标签、WorldArena 世界模型排行榜、世界人工智能大会/世界机器人大会的具身专场 - 中文源:机器人大讲堂、量子位/机器之心的具身专栏、中国人工智能学会具身智能白皮书
八、自测 Q&A:10 道题检验是否「真的入门」
1. VLA 和传统「感知-规划」流水线的本质区别是什么? 不是模块变粗了,而是动作进入了梯度:损失函数直接对「输出的动作对不对」负责,语言指令与视觉观测在同一个表征空间里共同决定动作——规划模块不再是规则写的。
2. 为什么动作多用 chunk 而不是单步? 单步预测会累积漂移且推理频率被控制环绑架;chunk 让一次推理覆盖一段未来,天然带时序一致性,还能降低推理开销。代价是开环执行期间对突发扰动反应迟钝。
3. Diffusion Policy 和回归式动作头各自适合什么? 回归头快但对多模态动作分布(同一状态有多种合理走法)会取平均输出「什么都不像」的动作;扩散/流匹配能表达多峰分布,代价是推理步数与延迟。
4. Sim2Real 三大鸿沟来源与三板斧? 视觉差/动力学差/观测差 → 域随机化、系统辨识、域适应。真机掉点排查先查标定与视角,再查接触摩擦,最后查延迟对齐。
5. 世界模型「物理接地」不够会怎样? 生成的视频看着真但违反接触与稳定性,用它评策略会系统性高估策略质量——推演评测必须先在真实 rollout 上做一致性校准。
6. BC 的分布漂移是什么、DAgger 怎么解? 策略偏离训练分布后进入没见过的状态、错误越滚越大;DAgger 让策略在环中行动、专家对它自己的状态标注纠正动作、把纠正数据回灌再训。
7. GRPO 用在具身上和用在自驾上有什么不同? 奖励更稀疏(成/败 0-1)、rollout 更贵(真机不能无限试错,常用仿真代理)、且要处理动作分布约束——所以往往只在微调阶段用,且要配安全层。
8. 跨本体数据怎么一起训? 本体标记(embodiment token)、统一动作空间(如都映射到末端 6D)、动作分词器共享——本质是给不同「身体」做条件化,让一个策略头学会读身体说明书。
9. 「物理-语义割裂」指什么?(方奇考题) 世界模型擅长物理延续但缺人类任务常识(为什么这样摆),具身大脑擅长语言任务推理但缺物理直觉(这样拿会滑);语义化世界模型的思路是把两者统一到三维语义空间里联合建模。
10. 你的自驾背景三个月后最能贡献什么? 不是「会用 Transformer」,而是被路测毒打出来的工程制度:数据归因闭环、开/闭环评测纪律、后训练配方经验、部署实时性直觉——这四样在具身团队里都还是稀缺品。
结语
具身智能不是自动驾驶的「远房亲戚」,它是同一场「学习型控制」革命换了一具身体。你带来的端到端直觉、流匹配手感、RL 后训练经验与数据闭环方法论,就是这场迁移里的硬通货;要补的,是那两层「硬」功夫——本体与控制——和对动作空间的敬畏。
接下来:按第五部分的 8 周计划走,每周回到这篇文章对照进度;读论文优先走第四部分地图,能用站内精读省下的时间全部砸到动手上。八周之后,当你站在面试官面前,你不是「转行的自驾工程师」,而是**「做过世界模型和后训练、现在来补机器人那半边的人」**。
祝顺利。🚀