📄 论文信息
第一篇:Zetta
- 标题:Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
- 团队:清华大学 AI 产业研究院(AIR)+ Z-Trans AI;一作 Xin Ding、Liang Mi(共同一作),项目负责人 Ting Cao(通讯),技术负责人 Xin Ding、Liang Mi
- 发表:arXiv 2608.16590v1 [cs.RO],2026-08-17,CC BY 4.0
- 资源:项目页
air-embodied-brain.github.io/zetta - 关键词:Embodied Harness、代码化 Critic、三时间尺度闭环、Z-Infra rollout 基础设施、frozen VLA
第二篇:EmbodiRSI
- 标题:EmbodiRSI: Recursive Self-Improvement for Data-Efficient Robot Adaptation
- 团队:Haoran Lang、Haotao Lu、Shiyu Sang(三位共同一作),通讯 Ye Shi、Jingya Wang(上海科技大学邮箱),含 Guo Chen、Qun Li 等
- 发表:arXiv 2609.38905v1 [cs.RO],2026-09-30,CC BY-NC-SA 4.0
- 关键词:Real2Sim2Real、递归自我改进(RSI)、协作纠错(CEC)、自适应数据采集(ADC)、RECAP 式优势标注
为什么把两篇放一起读:它们是同一思潮——递归自我改进(Recursive Self-Improvement, RSI)——在机器人上的两种落法。Zetta 冻结策略权重,认为「该进化的是策略外面那圈执行系统」;EmbodiRSI 不停改策略权重,认为「该进化的是喂给策略的数据分布」。一墙之隔,恰好互相补全。
🎯 一句话版本
- Zetta:给 frozen VLA 套一个会自我进化的「舱外执行系统」——代码写的运行时 critic 在动作频率上盯着执行,出了偏差由 orchestrator 裁决是否触发恢复;线下把失败轨迹聚类、做六层因果诊断、生成最小补丁,通过「历史回归 100% + 留出集 ΔSR>0」双门检验后打包成版本化技能包。策略一个字节没动,成功率涨了 20~40 个百分点。
- EmbodiRSI:从真实部署场景重建专属仿真(SAM3 分割 + SAM3D 重建 + 碰撞矫正),在这个「便宜且可重放」的沙盒里跑策略 rollout:协作纠错从策略卡住的状态生成矫正轨迹,自适应采集把专家示教定向砸向当前弱点,数据累积回训练、进入下一轮递归;最后只用每子任务 10 条真人纠错轨迹微调,真机成功率反超「200 条真机示教」的基线。
🧬 溯源一:RSI 从哪来——1965 年的一句猜想
很多同学第一次见「递归自我改进」这个词是在 LLM 圈,其实它的源头比深度学习早了半个多世纪。
1965 年,英国数学家 I. J. Good 在论文 Speculations Concerning the First Ultraintelligent Machine(Advances in Computers 第 6 卷,Academic Press)里写下那段著名推演:如果一台机器能设计出更好的机器,那么「智能爆炸」(intelligence explosion)就会发生——机器的最后一次发明,就是造出比自己聪明的后代。这段话后来被反复引用(千次量级的高被引),也是「技术奇点」叙事的文本源头。Good 当时关心的是机器改进机器这个递归结构本身,而不是具体哪种算法。
沿着这条线,改进的对象换了三拨:
- 改进「程序」:Schmidhuber 1987 年的可递归自改进系统、2003 年的 Gödel Machine(证明「改动对自己有益」后才允许自我修改)、PowerPlay(不断发明新技能的搜索)——这一支把 RSI 变成了可证明的搜索问题。
- 改进「提示与技能库」:2023 年 LLM 火了之后,Reflexion(语言化反思写进记忆)、Self-Refine(自我批评再自我修订)、Voyager(把可执行技能库越滚越大)、OPRO(用 LLM 优化提示词)让「执行 → 评估 → 反思 → 更新」这个循环在数字世界便宜地跑了起来。这一波就是 Zetta 相关工作里点名的数字域 RSI。
- 改进「策略与数据」:机器人领域起步更早但更慢——2011 年 DAgger 就示范了「让当前策略自己去跑、专家在旁边纠正、纠正数据回灌训练」的交互式数据闭环;2023 年 RoboCat 用自我生成的示教跨任务累积改进;2024 年 SOAR 让基础模型自主采数据、从无标注经验中学习;2025 年 RECAP 把示教、自主经验、纠错反馈用「优势条件」缝进同一个训练目标。到 2026 年,这条线集中爆发:VERITAS(视觉验证过滤自主 rollout)、RoboClaw(采集-学习-执行一体化)、RISE(世界模型内想象 rollout + 优势估计)、EmbodiRSI 与 Zetta。
上面这张自绘时间线把两拨先驱画在一起:上半是数字域 RSI(改程序/改提示),下半是机器人 RSI(改数据/改执行系统)。2026 年的四篇代表作里,EmbodiRSI 和 Zetta 各守住一个岔口——这也是本文只精读这两篇的原因:它们不是同一方案的重复,而是同一条思想树上的两根主枝。
补一个当下坐标:arXiv 2609.11873《The Last AI Built by Humans》把自主改进系统分成 L1
L5 五级(从「人设定改进循环」到「机器自己定义目标与评估」)。按它的标尺,Zetta 和 EmbodiRSI 大约处在 L2L3:改进循环是人预设的,但循环里跑什么完全由系统自己的失败证据决定。
🏷️ 溯源二:Zetta 的名字,和「Harness」这个词的来历
Zetta 是国际单位制前缀,10²¹(千的七次方),挨着我们在存储容量上熟悉的 exa/peta;论文里用希腊字母 ζ 做符号。选这个量级的词,姿态很明显:接续 Z-Trans AI 自家的 Z 系列(论文基础设施直接叫 Z-Infra),并暗示目标是把「物理智能」当成可随经验积累而指数增长的量来经营。同组系统里还出现过 Z-Harness 的叫法——Z 家族的「舱」。
Harness 本身不是新词,它的迁移路径值得捋一遍:
| 阶段 | harness 指什么 | 典型场景 |
|---|---|---|
| 软件工程 | 测试挂具:被测程序外面那圈负责喂输入、抓输出、判对错的脚手架 | 单元测试、CI |
| LLM Agent 时代 | Agent 挂具:把模型接进终端/浏览器/评测集的外壳(跑命令、收日志、打分) | SWE-bench、Terminal-Bench 类系统 |
| 具身时代(本文) | Embodied harness:包在 frozen VLA 外面的运行时感知 + 干预 + 恢复系统 | Zetta、HarnessVLA 等 |
所以「harness」这个词选得准:它是外面那圈不负责自己做任务、只负责让里面的模型把任务做稳的东西。软件测试 harness 判程序对错,具身 harness 判「这次抓取的物理状态还对不对」,不对就干预。论文引的同代工作 Harness VLA(arXiv 2607.08448,即其对比基线 RPent)把记忆引导的 agent 接到 frozen VLA 上,正是这条线的另一支。
读这两篇前的术语表(后文直接使用):
| 术语 | 含义 |
|---|---|
| VLA | Vision-Language-Action 模型:看图 + 指令直接输出动作的策略 |
| frozen / 冻结 | 推理时权重完全不更新,Zetta 全程如此 |
| WAM | World Action Model,世界动作模型(论文里与 VLA 并列的另一类基座) |
| LIBERO-Pro | 抗记忆化的 VLA 基准(arXiv 2510.03827),含 Goal-T/Goal-S 扰动与 LIBERO-10 两组设置 |
| RoboCasa | 大规模日常任务仿真基准(arXiv 2406.02523),本文用其 18 个 Atomic-Seen 任务 |
| π0.5 / GR00T N1.5 | 分别是 LIBERO-Pro 与 RoboCasa 上的 frozen 基座策略(Physical Intelligence / NVIDIA) |
| RPent | Zetta 的主要 agent 基线,来自 Harness VLA(ref [5]) |
| RSI | Recursive Self-Improvement,递归自我改进 |
| R2S2R | Real-to-Sim-to-Real,真实观测建仿真 → 仿真里改进 → 回真实部署 |
| ALOHA | 双臂低成本操作平台,EmbodiRSI 用 14 自由度版本 |
🧩 Zetta 深拆:把「反思」从 episode 之后搬到动作之间
1. 它到底在解决什么问题
论文开篇点的病灶非常具体:现有具身 agent harness 是开环的。执行开始后,agent 要么按固定技能走,要么按预设轨迹走,反思只发生在一整局结束之后(post-hoc reflection)。问题是物理交互不等人——抓取滑脱、接触丢失都发生在亚秒级,而大模型 agent 的推理频率根本追不上。于是形成一个尴尬错位:
大模型负责「想」,但它想得太慢;小模型/代码负责「动」,但没人教它什么时候该喊停。
论文把挑战拆成三条:
- 开环的语义-物理鸿沟:frozen 基座模型语义理解在线,但对物理状态漂移无感知,一局之内不会自我纠正。
- 过度参数化修复的泛化陷阱:直接调基座权重去修某个失败,等于用一个高维旋钮对准一个低维病灶,改完这个种子坏那个种子——所以 Zetta 宁可不动权重。
- 专家在环调试不可扩展:人工看日志改代码,人力是天花板,必须自动化。
对应的三条设计原则:高频状态治理(在动作频率上布署轻量 critic)、自顶向下分层因果诊断做最小干预(原话是「若高层逻辑能解决,绝不改低层参数」)、自动化进化泛化(把种子级修补抽象成机制级不变量,再用留出集验收)。
2. 形式化:双智能体治理 + 可进化舱体
Zetta 把系统切成「固定部分」和「可进化部分」:
- 固定:基座策略 π_VLA(或 WAM)与编排者 A_orch(Orchestrator)——连决策函数都不许变,防止单位点漂移;
- 可进化舱体 H = {C, R, T}:
- C(Critics):高频运行时监视器,输出结构化提案 P_t(哪里不对、证据是什么);
- R(Recovery):恢复剧本——发现问题后怎么把系统拉回可控状态;
- T(Toolset):可执行工具与算子(规划器、抓取检测器、恢复模块),会被生成、实例化、替换,而不只是调参。
裁决逻辑(论文式 3):执行中每一步的模式 σ_t 由编排者裁决:
σ_t = 0 表示继续走 VLA/WAM,σ_t > 0 表示切换到专用工具。K 是任务知识(预定义里程碑、成功判据、环境约束)。注意这里的关键约束:critic 高频提议,但只有证据被编排者接受才允许干预——既避免了「大模型每步都在环里」的延迟,又避免了「critic 一惊一乍」的误触发。
优化目标(论文式 5):
即:在 π 和 A_orch 不动的前提下,只优化舱体配置,让期望任务成功率最大。

Fig.1(论文第 1 图)四件事:① 高频运行时 critic 在执行中触发恢复;② 经验证的失败被蒸馏成可复用的 critic 与恢复技能,跨 rollout 复用;③ 硬件解耦的 rollout 层把这套流程铺到异构环境/模型/CPU/GPU 上;④ 由此得到持续同任务改进、零样本技能迁移、机器人「Aha Moment」和执行加速。
上面这张自绘图是全文骨架:左边是在线环(rollout → critic 提议 → orchestrator 裁决 → 恢复/回控),右边是离线环(Phase I 失败画像 → Phase II 诊断修复 → Phase III 合并打包),中间靠「验证门」交换信任——离线产出的舱体补丁必须过门才能回流在线。两个环的频率差就是论文的核心设计变量:在线环跑在动作频率,离线环跑在迭代频率。

Fig.2 逐栏拆解:
- 左(Parallel Rollouts):动作策略执行任务,Evolvable Harness(H = C/R/T)在其上监控,Orchestrator 做高层裁决;rollout 结束按成败分成成功/失败两类轨迹。
- 右(Reflection & Evolve):失败轨迹触发离线三阶段——Phase I 把失败对成功基线做聚类画像;Phase II 做因果诊断定位根因层 L*,随后做最小舱体修复(更新 C、R、T);Phase III 把种子级补丁泛化成统一的版本化舱体包 H_merged,再喂回执行循环。
3. 三个时间尺度的循环(论文的灵魂)
| 循环 | 频率 | 干什么 | 让系统获得什么 |
|---|---|---|---|
| Loop 1:Critic-Governed Action Loop | 动作频率 | 学到的 critic 随每步执行跑,必要时调用对应恢复技能 | 闭环执行(当帧干预) |
| Loop 2:Rollout-Batch Candidate Optimization Loop | rollout 批频率 | 对每次迭代的失败做聚类、诊断,提出候选 critic 与 recovery | 自进化(提出补丁) |
| Loop 3:Validation-Gated Skill Update Loop | 迭代频率 | 只放行「提升成功率且跨 rollout 泛化」的候选,写入技能记忆 | 自进化(验收补丁) |
有个容易忽略的细节:Loop 2 里没有梯度可下降——技能和代码不提供梯度。论文明确借用了 SkillOpt 与 EmbodiSkill 的思路,构造一个 SGD 式的代码空间优化过程:诊断相当于「算损失」,修复补丁相当于「一步更新」,验证门相当于「验证集早停」。把 LLM 写代码的过程类比成梯度下降,是这套方法论最好玩的一步棋。
4. Phase I:失败画像——先把病历写规范(Loop 1 落地)
Phase I 的产出叫失败种子清单 M_fail,靠三件套:
- 确定性调度与执行协议:同种子、同随机性地重放,保证证据可比;
- 多维证据采集:不止看最终成败,还采过程证据;
- 分类与索引:给每条失败轨迹挂上结构化标签。
它回答的问题朴素但关键:不是「它失败了」,而是「它从哪一步开始不像成功的样子」。
5. Phase II 第 1 步:聚类 + 诊断——按「最早偏离点」分类
机制级失败聚类。论文拒绝按最终结果做表面分类,改用 Earliest Observable Divergence(EOD):在轨迹里找第一个偏离「健康分布」的时刻(论文式 10):
配合 第一个缺失的里程碑 m*、机器人-物体相对位姿、活跃工具 ID,把 M_fail 切成互斥的失败簇 {K_1…K_n}。再给每个簇挑一个medoid seed(特征空间里离簇心最近的样本)作为深度诊断对象——等价于「不修平均病例,修最有代表性的病例」。
单视图接地观察协议:为防多模态模型在多视角之间「幻觉空间关系」,诊断只锚定一个主视图——这是对 VLM 老毛病的工程性防御。
自顶向下六层因果诊断(论文式 11)。对选定种子按固定优先级逐层排查,找最高优先级的根因层 L*:
| 层序 | 层 | 检查什么 |
|---|---|---|
| 1 | Evaluation | 成功判据/里程碑逻辑本身写错了? |
| 2 | Critic | 运行时 critic 漏报(false negative)或误报(false positive)? |
| 3 | State | 物体位姿/接触信息偏离物理真值? |
| 4 | Planning | 状态正确但策略/工具没处理好物理约束? |
| 5 | Recovery | 失败发生在恢复过程中——恢复剧本本身有缺陷? |
| 6 | Parameter | 具体控制增益、动作阈值的问题? |
「从上往下修,能不动参数就不动参数」这条纪律,保证了补丁落在最小有效层,基座模型完整性不受侵蚀。诊断完还要在簇内其他成员上验证机制一致性,最后输出修复候选规格:定位的层 + 因果证据链 + 对 (C, R, T) 的功能需求。
6. Phase II 第 2 步:最小修复 + 「回控契约」
修复由 Repair Agent A_repr 执行,产出补丁 H_patch = {C*, R*, T*}:
- Critic Enhancement:开发或细化高频监视函数,捕捉该失败的前兆条件(而不是事后症状),偏差时生成结构化提案;
- Recovery Drafting + Tool Adaptation:写恢复剧本、适配或合成可执行工具。
其中最值得抄的一个设计是 VLA 回控契约(Re-entry Contract,论文式 12)——恢复不是「做完就还手」,而是要满足一个显式谓词才准把控制权交还 frozen 策略:
两个条件缺一不可:当初的失败证据被显式清除(防「带着病交接」),且物理状态达到平衡(接触力稳定,防在抖动瞬间回控)。这本质上是把分布式系统里的「两阶段提交」思想搬进了机器人控制权交接:恢复动作最危险的时刻往往不是失败当下,而是交接那一瞬间——早一帧回控,策略就会在坏状态上继续作死。
修复后还有闭环验证协议:诊断性重放(对着原失败证据确认修复有效)+ 新鲜 rollout(确认不是过拟合某条轨迹),两步都过才算修复成功。
7. Phase III:合并、打包、双门验收——补丁如何变成资产
Generalization Agent A_gen 干的是「从个案到通则」的活:
- 机制合并:把一个失败簇内多条验证过的补丁做 OR-merge,抽成机制级不变量,得到统一舱体 H_merged;
- 打包外置(保证可移植与版本管理):
SKILL.md:高层治理逻辑——里程碑 M、编排者裁决规则、泛化的回控谓词 Ψ;tools/:进化后的 critic 与工具集的可执行实现;plans/:泛化的恢复剧本;params/:参数化配置。
双门验收(防自嗨的两道闸):
- 历史回归(论文式 15):新舱体必须对原失败簇内所有种子达到 100% 成功率——一个都不许漏;
- 留出评估(论文式 16):在严格隔离的留出集上算成功率增量 ΔSR = SR(D_held-out | H_merged) − SR(D_held-out | π_VLA),必须为正。
动态转场协议更狠:如果留出集暴露出新的失败机制、逼着你再去改 H_merged,那么这个被「污染」的留出种子会被降级为开发种子,必须重新领一份从未见过的留出集才能结束本迭代。翻译成人话:验收集只许用一次,用过了就不干净了。 这是对「一边刷留出集一边迭代」这一常见学术操作的制度性封堵。
8. Z-Infra:把 rollout 吞吐当成智能的限速器
论文有句很漂亮的论证:环境是学习数据的来源,rollout 越快,进化越快——所以吞吐就是自进化智能的限速器。 为此他们专门做了 Z-Infra(自称首个为自进化具身智能体设计的 rollout 基础设施),架构见下图:

Fig.3 三层分工:
- Control Plane(控制面):接收 agent 的虚拟 rollout 接口请求(「执行什么」),负责路由、会话管理;
- Env Worker 层:管环境模拟——CPU 型仿真(MuJoCo/robosuite 逐会话维护状态)、GPU 并行仿真后端、渲染,各有各的生命周期与资源组;
- Rollout Worker 层:管模型推理——调度器、模型切分(VLM 与动作专家分开放)、量化运行时、动态批处理与异步调度。
它要同时解决两个麻烦:资源异构(一次 rollout 里既有微秒级 CPU 算子、又有吃显存的自回归/扩散动作生成、还有 CPU 密集的物理步进,单一资源池和调度策略都不适配)和执行动态性(agent 动态决定调哪个工具,这一步可能只调策略、下一步连着感知规划一串,会话创建/暂停/销毁完全不规律——静态分配必然浪费)。解法是解耦抽象层:agent 只说「做什么」,基础设施管「在哪做、怎么做」,加机器不改 agent 代码。
性能数字(Z-Infra 实验,8×A100,LIBERO Goal,并发 1/8/16/32/64):
- 吞吐:RPent 1.72 条/分 → 自家无 Z-Infra 2.88 条/分 → 有 Z-Infra 并发 8 时 12.18、并发 16 时 22.09(7.7× vs 无 Z-Infra,12.8× vs RPent)、并发 32 时 32.8、并发 64 饱和在 35.1 条/分(20.6× vs 基线起点 1.7);
- 延迟:Z-Infra 单局延迟并发 8→32 只从 39s 涨到 57s(+46%),并发 64 才到 95s;自家无 Z-Infra 则从 34s@8 直接爆到 112s@16;RPent 因为每个决策点都要调 LLM API,基线就高得离谱(392s → 513s);两个基线在并发 16 以上直接 OOM;
- 端到端:对比 RPent,推理延迟 −91%(11.1× 加速),单局延迟 11.9×。
这里有个设计上的清醒:大模型只在离线 Reflection & Evolve 阶段出现,在线 rollout 全程是「纯 VLA + 轻量运行时 critic」。这正是 Zetta 对「大模型在环延迟」问题的正面回答——不是把大模型调快,而是把它请出执行环,只留下它产出的代码站在环里。
9. 实验:两套基准、两条泛化协议、8×RTX 4090
实验设置(论文 4.1 节):8 张 RTX 4090 做并行 rollout 与离线进化;LIBERO-Pro 用 π0.5 做 frozen 基座,RoboCasa 用 GR00T N1.5;全程不微调基座权重。两套基准各配一条严格隔离的泛化协议:
| 基准 | 开发集 | 进化循环 | 最终考核(held-out) |
|---|---|---|---|
| RoboCasa(随机分布泛化) | 每任务随机采 50 个环境种子 | 每轮收失败轨迹、按失败签名聚类、取 medoid 种子诊断修复 | 另一拨严格不相交的 50 个种子 |
| LIBERO-Pro(开发-测试泛化) | 每任务 50 个父种子(排除种子 1~20) | 聚类后针对最大失败簇的错误种子修复,开发种子成功率 ≥50% 即停 | 只考种子 1~20 |
主结果一:RoboCasa 18 任务(论文 Table 2)——宏平均从 frozen 基座的 73.56% → 93.56%(+20.00pp),四轮全局修复的爬坡轨迹是 73.56 → 78.71 → 84.85 → 90.54 → 93.56。因为 VLA 全程冻结,这 20 个点全部是舱体里验证过的执行知识的积累,不是模型容量换来的。
主结果二:LIBERO-Pro 40 组任务-设置(论文 Table 3)——总体宏平均 32.00% → 71.13%(+39.13pp),分项:
| 设置 | frozen π0.5 | Zetta | 增量 |
|---|---|---|---|
| Goal(T)任务/指令重定向 | 31.0 | 92.5 | +61.5 |
| Goal(S)交换/位置互换 | 38.0 | 89.0 | +51.0 |
| LIBERO-10(T) | 50.0 | 63.0 | +13.0 |
| LIBERO-10(S) | 9.0 | 40.0 | +31.0 |
40 组里 32 组提升、8 组持平、零组变差。论文摘要里的头条数字 34.5% → 90.8% 就是 Goal(T) 与 Goal(S) 两个设置的平均((31+38)/2 = 34.5 → (92.5+89)/2 = 90.75)——读这类论文要小心口径:只算 Goal 扰动集很好看,算上 LIBERO-10 的整体是 71.13%,两者都真实,但用途不同。


Fig.6a/6b(累积进化曲线):横轴是「选定的累积舱体版本」,纵轴是十任务平均成功率,两条曲线分别对应 Goal-T 与 Goal-S 扰动。每个点只代表舱体在长大、VLA 没动。 曲线形状值得注意——不是匀速爬坡,而是「平台 → 跳变 → 平台」,这正是下一段 Aha Moment 的宏观投影。
10. Aha Moment:平台期之后的跳变
论文把「停滞很久然后突然拉起」定义为 Aha Moment,并强调这些 checkpoint 是离线诊断过程中的内部版本(v0→v1→v2),既不是新 rollout 轮次也不是 VLA 训练:
- LIBERO-Pro Goal-T2(把瓶子放进碗):v1 加了「预抓取 staging」改善接近几何,成功率只有 10%→15%(停滞,因为没解决运输途中丢物体);v2 真正定位瓶颈是抓取保持,加了一个「运输前验证持物稳定性」的 critic,直接跳到 95%;
- Goal-T8:v1 微升 5%→10%(弱抓取没解决),v2 用恢复技能盯住「接触-抓取-保持」全序列,拉到 60%;
- Goal-S6(放奶油奶酪):v1 修「释放门」只治了晚期症状(5% 停滞),v2 把注意力挪到接近阶段缺乏语义进展,一个校准过的语义抓放恢复同时解决接近/抓取/运输三段,冲到 90%;
- RoboCasa:TurnOnElectricKettle 88%→94%(顿悟是「末端执行器简单重对齐就能恢复 VLA 期待的几何」)、SlideDishwasherRack 76%→94%(关键是接触丢失后重建居中接触)、CloseToasterOvenDoor 82%→96%。
聚合数字:Wine Bottle in Bowl 15% → 95%、Put Cream Cheese on Bowl 5% → 90%。论文由此提出一个很有力的论断:物理智能的可扩展单元不是轨迹,而是「状态变量的识别」——抓住「抓取稳定性」「接近几何」这类任务无关变量,一个 critic 就能救活一整片失败。
11. 零样本技能迁移:改一个任务,救活三个任务
这是我认为全文最漂亮的实验设计。源任务上累积出的三件套,不加任何目标任务优化直接搬过去:

Fig.10(Pick-and-Place 线):源任务 PnP-Stove 78% → 84%(预抓取对齐)→ 94%(抓丢后重抓)→ 96%(稳定放置);把这套累积栈零样本投到三个目标任务:
| 迁移目标 | Pure VLA 基线 | 迁移后 |
|---|---|---|
| PnP-Sink | 58% | 82% |
| PnP-Cabinet | 62% | 80% |
| PnP-Toaster | 72% | 90% |
| 宏平均 | 64% | 84%(+20pp) |

Fig.11(铰接交互线):源任务 TurnOffStove 74% → 82%(目标旋钮接管)→ 84%(预接触)→ 92%(稳定接触);右侧三格配图是三轮演进的失败→恢复对比——「转错旋钮 → 定位对的旋钮」「接近没对准 → 对准」「接触不稳 → 稳定接触」。迁移结果:
| 迁移目标 | 基线 | 迁移后 |
|---|---|---|
| TurnOnSinkFaucet | 74% | 90% |
| OpenCabinet | 62% | 78% |
| TurnOnMicrowave | 56% | 72% |
| 宏平均 | 64% | 80%(+16pp) |
两次迁移的共同点:被复用的技能全都作用在任务无关的物理量上(末端对齐、接触稳定、持物保持),而不是记住了源任务的轨迹。LIBERO 上也有同样的实验(Fig.7 以 Goal-T8 为源迁到 T2/T6/S3,其中 Goal-S3 从 9/20 → 20/20;Fig.8 以 Goal-S5 为源)。
12. 两个案例研究:一次 aPnP 的连续干预,与失败边界的推进

Fig.12:VLA 先抓起并搬运物体 → 一个 critic 检测到抓取丢失、触发重接近恢复 → 恢复里发现重抓位姿无效,调用 GraspGen 合成可行抓取位姿 → 接近目标时,最后一个 critic 调用稳定放置。一个回合里三次不同层级的干预,展示了 C/R/T 三件套如何接力。

Fig.13:父 VLA 在 Goal-S5 上耗尽执行预算也等不到及时的恢复交接;随后每一轮 promotion 加一件装备——持物门控交接 → 接触门控抓取恢复 → 有界重抓重试——每件新增装备都消灭一类残余失败,「失败边界」被一轮轮往外推。这张图是「累积进化」最直观的诠释:不是换更强的模型,是给同一个模型逐件配齐安全带。
13. Zetta 的边界(读完必须记住的三条)
- 全程仿真验证,没有真机。所有成功数字来自 LIBERO-Pro 与 RoboCasa 模拟器;critic 读的接触力、物体位姿在真机上要么传感器没有、要么有噪声,移植时「单视图接地 + 状态证据」的假设要重做。
- 任务知识 K 是人给的。里程碑、成功判据、可接受的接触阈值 γ 都预置在 SKILL.md 里——进化优化的是「怎么达到你定义的成功」,不是「什么算成功」。
- 「under our current rollout budget」这个限定词作者自己反复出现。曲线仍在上涨意味着数字未饱和,但每一分提升都以大规模并行 rollout 为代价(这正是他们要做 Z-Infra 的原因),复现成本不低。
🤖 EmbodiRSI 深拆:让「要采什么数据」跟着「现在哪里失败」走
1. 它在解决什么问题
具身策略适配新任务/新环境太吃数据,而论文点出一个循环依赖:下一步最需要的数据,取决于策略现在的失败模式——策略变了,弱点就变了,固定分布采一批数据用到底的做法天然低效。EmbodiRSI 的回答是把改进做成递归:每轮 rollout 的反馈,直接决定下一轮采什么数据、生成什么矫正轨迹。

Fig.1(论文第 1 图)读法:真实观测 + 任务目标 → 构建可执行仿真环境与经过验证的示教;在这个环境里,rollout 反馈驱动两条互补通路——协作纠错(CEC)与自适应数据采集(ADC);产生的经验更新策略进入下一轮,形成递归循环;最后用一小份**真人在环(HIL)**数据集微调,得到可自主部署的策略。
自绘大图强调递归预算这一点:R0/R1/R2 三轮用 50/200/400 条保留仿真轨迹,轮数和配额预先固定——反馈只决定「预算内怎么花」,不决定「花多少」。这是系统与「无限自改进」幻想的分界线。
2. 第一环:把部署场景变成可执行仿真(Real2Sim)
对象级重建:VLM 先在输入图里认出桌子和可见可动物体 → SAM 3 出实例掩码 → SAM 3D 重建带纹理网格,场景表示为 S_0 = {桌子 o_T, 物体 o_1…o_N},每个物体带语义类别、网格与 SE(3) 初始位姿(论文式 B.1)。物体身份贯穿场景编辑与轨迹生成全程——指令说的「遥控器」和几何检查、机器人程序里的遥控器必须是同一个对象。

附录场景管线图分上下两段:
- (a) 编译可执行初始场景:观测重建 → 支撑感知碰撞矫正(AACR) → 验证过的工作区 S_0。AACR 又分两步:**PHR(并行水平矫正)**把相交的物体组当整体向外分离,保住组内关系、只对扫掠区不相交的组并行批量处理;**AIR(组内自适应矫正)**按物体关系选算子——同支撑面的用水平分离、包含关系用垂直调整、插入式排布用有界倾斜。语义推理决定用哪个几何算子,碰撞检查负责验证,两者不互相替代。
- (b) 精化任务导向布局:渲染三视图(正/顶/侧)检查 → 场景智能体先提粗关系(在…上面/里面/旁边)再做逐物体位姿精修 → 批评-验证环节检查支撑、碰撞与任务关系,不接受就要求可执行的位姿编辑、再渲染;接受后得到初始/组织后场景对 (S_0, S_org),两者的差异就是物体级操作目标。

批评-调整闭环配图更直观:语言指令(“Please tidy up the desk”)+ 目标布局图 → 3D 场景生成 → Critic Agent 重渲染并打分(示例输出 "score": 76, "pass": false, "issue": "Remote outside tray",反馈「把遥控器挪到托盘中心」)→ Adjustment Agent 产出结构化动作 JSON(screen_translate、rotate_deg、snap_to_table)→ 更新场景状态(物体表、坐标系约定、正/顶/侧视图)→ 打分通过则落定为 Final Scene。场景构建本身就是一个带批评器的 agent 循环,和 Zetta「critic + 修复」的形制遥相呼应,只不过这里修的是场景而不是执行。

重建示例图给了三种输入来源的重建质量直觉(移动相机实拍、机器人相机实拍),下方是任务导向组织:初始布局 → 目标布局,示例目标关系如 “Remote into tray"“Mouse onto pad”——注意图里那行小字:这些是轨迹生成的输入,不是对重建质量的评测。附录还有更大画廊(含网页图、AI 生成图输入):

画廊按输入来源分四行(移动相机、网页图、机器人相机、AI 生成),每格都是 Input vs Reconstruction 对照,底部标注**「仅定性示例;外部与合成输入不计入基准试验」**——对「拿好看的重建图当定量结果」防得很严。
轨迹智能体:把场景对编译成可执行任务配置与验证过的示教——先提物体空间路线,经 GraspGen 投出抓取候选,再用 cuRobo 校验完整机器人程序;准入条件包括扫掠体碰撞检查、多视角复核、顺序运动可行性、执行时任务检查,不合格的修复重验或直接拒绝;存储的 waypoint 锚定在源/目标位姿上。这一步等价于给仿真环境配了一个不发假数据的出纳——进训练集的每条示教都先过物理验证。
3. 第二环:仿真内的 RSI 循环(方法核心)

上图就是论文 Fig.2 的完整信息流,四个模块顺时针转:
① Agentic Rollout Monitor(论文式 1)。监视器 agent 融合时间图像窗口 + 动作历史 + 仿真器物体/机器人状态,输出三选一决策:
视觉证据负责识别抓空、打滑、放错位置;程序化检查量测目标-物体误差与夹爪状态;完成判定要求视觉决策与几何成功同时成立;恢复请求要过四道闸——置信度、冷却期、尝试预算、持物测试(防止打断正在进行的有效搬运)。所有决策连同配置 ID、场景状态、失败证据一起落日志。注意一个刻意设计:仿真器的物体位姿只用来支撑这些监视/训练工具,不喂给被学习的策略——评测时策略的输入仍是纯 RGB + 本体感觉 + 指令。
② Collaborative Error Correction(CEC,论文式 2)。核心原则一句话:恢复必须从策略实际到达的状态把任务做完,而不是从初始状态重放一份干净示教。 触发时刻 t_f,把标称抓取位姿通过物体位姿变换搬到现在的位置:
候选配置按确定顺序试探但不推进仿真;入口运动从当前关节状态规划,目标重新锚定到当前场景;诊断与规划期间仿真时钟暂停。纠正完成后刷新观测、检查完成、满足恢复闸再把控制权交还策略。这套机制的红利有两层:回合内它救命(失败状态被拉回来),回合外它产数据——成功续接的轨迹提供了「从不完美状态出发」的动作监督,正是标准示教里最缺的那一段。
③ Adaptive Data Collection(ADC,论文式 3、4)。把采集分布对准当前策略的已诊断弱点:
- 每轮采集后,agent 把最终失败归因到「源物体复位」「目标锚复位」或「都不是」;归因可缓存复用,不重复调 VLM;
- 把复位位置归一化到网格,算归因失败率 r̂ = U/N(分母是该格完成且位置有效的监控回合数,分子只计有支撑归因的最终失败——经恢复成功的回合不进分子,这套统计描述的是「辅助采集」而非「无辅助测试」表现);选格要求:观测与归因失败都够量,且失败率超过该主体的全局失败率;
- 选中的格映射回世界坐标,收紧对应复位范围(支持够时连朝向一起收);随后按混合分布采新示教:
p_hard,k 把采样集中到已诊断的弱配置,p_0 保证 α<1 时原始分布仍可达;且该精化只作用于训练采集,测试时复位完全不动——防止「考题跟着复习范围走」。
④ 数据累积与策略更新(论文式 5~7):
实现里 R_t = 0、n = 50,二值标签完全由价值估计的变化决定;优势标签以文本条件的形式喂给动作预测,记录的动作仍是监督目标。价值模型与策略共用同一视觉-语言骨干(同检查点初始化)加价值头。外层由 OpenClaw 监督者经 MCP 接口协调整个 RSI 工作流,智能体系统基于 GPT-5.5,仿真平台为 Isaac Sim。
Algorithm 1 把流程收成 12 行:建仿真 → 采 D_0 训 π_0 → 每轮(rollout + 诊断 + 符合条件的状态条件恢复 → 保留 D_k^roll → 归因失败按式 4 形成 p_{k+1} → 在 p_{k+1} 下生成验证过的 D_k^new → 按式 5~7 累积、标注、训练 π_{k+1})→ 少量真机 HIL 微调 → 只用学到的策略独立评测。最后这句是防作弊关键:终评关闭 agent 接管、规划器恢复与人工纠正——测试时的重试也只能是策略自己学会的行为。
4. 实验:三个场景、14 个子任务、一台双臂 ALOHA
设置:14 自由度双臂 ALOHA(两个腕部相机 + 一个头相机,仿真观测与之对齐),配对工作区 S1 办公桌(6 子任务)、S2 厨房桌(4)、S3 家务桌(4),每场景一个策略;R0 从 π0.5 检查点初始化;R0/R1/R2 分别保留 50/200/400 条仿真训练轨迹/子任务;HIL 阶段再加每子任务 10 条真人纠错轨迹;所有测试纯策略、无外部恢复,真机每任务每设置 10 次试验;汇总用场景均衡均值。

Fig.3 上排真机工作区、下排对应仿真环境,逐列同场景——「配对」是全文可信度的地基:仿真里改进的每个子任务,真机上都有同定义的考题。
结果一:递归轮次自身在涨(论文 4.1 节)。场景均衡仿真自主成功率 50.4%(R0)→ 70.7%(R1)→ 83.5%(R2),14 个子任务全部从 R0 涨到 R2(例如 S1 黑笔放置 14.0% → 76.5%)。质性观察与两条反馈通路吻合:早期策略抓空后仍继续搬运,后期抓取更稳、且会主动重试无效交互(部分重试直接完成任务);50 条示教初始化时策略还会混淆红帽记号笔与红笔的指令,预算加大后这种指令混淆不再复现,残余错误转为纯执行错误。
结果二:等预算对比——自适应 vs 静态(论文 Table 1,S1+S3,400 条/子任务):
| 方法 | 仿真 | R2S2R | R2S2R + HIL |
|---|---|---|---|
| EmbodiRSI w/o RSI(静态采集) | 59.3 | 46.3 | 67.9 |
| EmbodiRSI | 79.9 | 59.2 | 82.1 |
| 增益 | +20.6 | +12.9 | +14.2 |
同样 400 条数据,数据怎么来的造成 20 个点的仿真差距;而且这优势穿过真人微调仍然保留(+14.2pp)——不是「仿真里自嗨、回真机清零」。
结果三:数据效率(论文 Table 2,真机,场景均衡):
| 训练设置 | S1 办公 | S2 厨房 | S3 家务 | 场景均衡 |
|---|---|---|---|---|
| R1(200 仿真条) | 43.3 | 60.0 | 52.5 | 51.9 |
| R1 + 10 HIL | 63.3 | 82.5 | 75.0 | 73.6 |
| R2(400 仿真条,零样本上真机) | 53.3 | 70.0 | 65.0 | 62.8 |
| R2 + 10 HIL | 81.7 | 85.0 | 82.5 | 83.1 |
| 纯真机示教 10 条 | 13.3 | 45.0 | 20.0 | 26.1 |
| 纯真机示教 100 条 | 56.7 | 62.5 | 52.5 | 57.2 |
| 纯真机示教 200 条 | 70.0 | 77.5 | 77.5 | 75.0 |
头条数字由此而来:400 条仿真 + 每子任务 10 条真人纠错 = 83.1%,打赢「每子任务 200 条纯真机示教」的 75.0%——物理轨迹用量只有对方的 1/20。 另注意 R2 零样本上真机已有 62.8%:仿真里递归出来的能力确实能直接搬过物理-仿真鸿沟,HIL 只是修残差(例如 S1 红笔放置 R2 前固定 2/10,HIL 后 7/10;而眼镜放置 HIL 前就已 10/10)。

真机执行示例图给的是两种训练配方下的执行对比:左侧纯真机 200 条示教、右侧 EmbodiRSI 配方(400 仿真 + 10 HIL),配合论文描述可归纳两类典型差异——抓取对齐的一致性与失败后重新尝试的能力(后者是 CEC 在仿真里反复喂「从失败状态续接」数据的直接产物)。
结果四(隐含的反面教材):窄开口放置类子任务在两种配方下都会暴露近接触误差(笔放不进笔筒),但论文也诚实指出受约束放置并不注定失败——这类「难任务」正是 ADC 归因网格最该盯的地方。
5. EmbodiRSI 的边界(论文 Limitations + 我们补的两条)
- 只验证了场景内适配:没有留出工作区(held-out workspace)实验,跨场景泛化未检验;
- 系统级研究,无组件归因:恢复、重采集、agent 推理是联合作用被评测的,CEC 和 ADC 各自贡献多少没有拆(作者承诺后续补消融);
- (补)递归深度受预算封顶:轮数与配额预设,RSI 在这里更像「聪明的两轮数据配比」,而非开放式的持续自我超越;
- (补)重建误差决定上限:SAM3D 重建的几何/物理属性若失真,ADC 的归因与 cuRobo 的验证都会在错误的地基上打转(论文靠 AACR + 逐项校验缓解,但未给重建误差的定量评估)。
🌍 第三形态:世界模型当「想象沙盒」——RSI 的另一半拼图
两篇论文之外,2026 年的具身 RSI 还长出了第三根枝,值得单独交代,因为它和你的世界模型工作线直接相关。
如果按「递归里跑的是什么」给 RSI 分类,会得到三种形态:
- 工具链自改进(改代码/改技能库):Voyager 一脉,Zetta 是它的具身形态——递归的对象是 critic、恢复剧本、工具集这些可执行代码资产,策略本身不动。
- 数据自循环(改数据分布):DAgger → SOAR → RECAP → EmbodiRSI——递归的对象是「下一步采什么」,每轮 rollout 的失败反过来当采集器的输入。
- 想象递归(改环境本身):RISE 用组合式世界模型做策略改进——在学到的世界模型里做想象 rollout、做优势估计,再回真实机器人验证(论文报告在动态抓放、背包收纳、关箱等任务上较基线提升 35/45/35 个百分点量级);Dream-RSI(arXiv 2609.14858)走得更远,主张「可重放的模拟器就是可递归探索的世界」,把 RSI 从「改进策略」上升到「递归探索算法、内核与数学工具本身」。
三者其实可以叠着用:世界模型产想象数据(形态 3)→ ADC 式采集器挑数据(形态 2)→ 失败蒸馏成 critic 代码(形态 1)。GigaWorld-0 那类「世界模型当数据引擎」的工作解决「数据从哪来」,Zetta 这类 harness 解决「执行怎么稳」,Dream-RSI 这类工作追问「递归的边界在哪」——三张拼图合起来,才接近《The Last AI Built by Humans》里 L4~L5 的图景。
⚖️ 两篇对照:同一思想,两种物理形态
| 维度 | Zetta | EmbodiRSI |
|---|---|---|
| 核心信念 | 该进化的是策略外面的执行系统 | 该进化的是喂给策略的数据分布 |
| 冻结什么 | π_VLA 与 A_orch 全程冻结 | 每轮都更新 π(从上一轮继续训) |
| 优化对象 | 舱体 H = {critic, recovery, tools}(代码资产) | 数据集 D 与参数 θ(+ 采集分布 p) |
| 反馈进化的通路 | 失败 → 聚类诊断 → 修复补丁 → 打包回流 | 失败 → 归因网格 → 定向采数 + 纠错轨迹 → 训练回流 |
| 回合内干预 | critic 提案 + orchestrator 裁决触发恢复 | 监视器 y_t 决策 + CEC 状态条件恢复 |
| 质量闸门 | 历史回归 100% + 留出 ΔSR>0 + 验收集一次性 | 归因统计阈值 + 逐条示教物理验证 + 终评关闭 agent |
| 智能体模型角色 | 只在离线写代码(在线零 LLM 调用) | 只在数据管线里当监督者(评测时零接管) |
| 评估硬件 | 8×RTX 4090(进化)+ 8×A100(Z-Infra) | Isaac Sim + GPT-5.5 agent + 真机 ALOHA |
| 验证落点 | 纯仿真基准(LIBERO-Pro / RoboCasa) | 仿真 + 真机(3 场景 14 子任务,10 次/设置) |
| 头条数字 | Goal 集 34.5→90.8;RoboCasa 73.56→93.56 | 仿真 50.4→83.5;真机 83.1 vs 75.0(1/20 物理数据) |
| 延迟哲学 | 把 LLM 请出执行环,代码站岗 | 把 LLM 放进采集管线,策略裸考 |
| 主要短板 | 无真机、任务知识人工预置 | 单场景适配、无组件消融 |
最有意思的一行是**「回合内干预」**:两篇其实都做了「失败状态下的回合内恢复」(Zetta 的 Recovery、EmbodiRSI 的 CEC),但产出物截然不同——Zetta 把恢复写成可复用的代码技能,EmbodiRSI 把恢复轨迹直接当训练数据。一个存「经验的规则形态」,一个存「经验的数据形态」。
💡 深度评析:三个最妙的设计,三个要留心的边界
三个最妙的设计
- 「大模型出环,代码进环」的分工。两篇从两侧逼近同一个答案:物理执行环里容不下大模型的延迟(Zetta 干脆只在离线调 LLM;EmbodiRSI 的测试时直接禁止 agent 接管),于是大模型的智慧被蒸馏成两种可慢速消费的产物——Zetta 是代码(critic/剧本),EmbodiRSI 是数据(矫正轨迹/归因)。这是「快慢系统」在具身上的工程落地:快环跑小模型,慢环养大模型。
- 两套防自欺的验收制度。Zetta 的「历史回归 100% + 留出集一次性使用、污染即降级」和 EmbodiRSI 的「测试关闭所有辅助、每条示教先过 cuRobo 物理验证」,都是针对「评测被迭代污染」这一顽疾的制度性防御。方法论论文最该学的往往不是模型结构,是这些看似琐碎的protocol。
- 失败的「归因网格」与「最早偏离点」。EmbodiRSI 把最终失败归因到具体复位格子再收紧采样(r̂ = U/N),Zetta 用 t_EOD + 首个缺失里程碑聚类——两者都在做同一件事:把「失败」从一个标量变成一个有坐标的对象。只有失败带坐标,改进才有方向;这也是「数据/代码跟着弱点走」能够成立的数学前提。
三个要留心的边界
- 验证鸿沟的分布不均:Zetta 全仿真、零真机;EmbodiRSI 有真机但只有 1~3 个桌面场景、14 个子任务。「闭环自进化」在模拟器里的成立条件(状态可观测、可完美重放)在真机上会被传感器噪声和不可重置性逐条打破——谁先把这套闭环搬到真机长时段运行,谁就拿下下一个身位。
- 成功的口径与成本:Zetta 的 90.8% 只算 Goal 扰动集(全集 71.13%),且每个百分点背后是「50 开发种子 × 多轮 rollout × 每轮 LLM 离线诊断」的账单;EmbodiRSI 的 83.1% 依赖 GPT-5.5 管线 + 每场景独立策略 + 预算封顶。RSI 现在是「用计算和 token 换数据效率」的生意,账要算总成本。
- 谁定义成功,谁就拥有进化的上限:Zetta 的里程碑与成功判据写死在任务知识 K 里,EmbodiRSI 的目标布局由 agent 对照目标图打分——系统优化的是「逼近人给的成功定义」。把「什么算成功」也交给系统自己发现(即 L4/L5 的评估自主性),目前只有 Dream-RSI 那条想象递归线在试探,成熟度远低于这两篇。
和你读过的工作拼起来
- GigaWorld-0 / Cosmos-3(世界模型当数据引擎)↔ EmbodiRSI(数据引擎自己会看菜下饭):前者解决产能,后者解决配料方向;把 GigaWorld 的合成管线接上 ADC 式弱点归因,就是「世界模型版的 EmbodiRSI」。
- RDT / Flow Matching 动作专家(策略本体)↔ Zetta(策略的舱外挂具):策略再强也有执行期故障分布,frozen 策略 + 会进化的舱是与「继续堆参数」正交的一条路。
- Flow-GRPO / 后训练 RL(改权重的另一派):Zetta 用「不动权重涨 20~40 点」证明了执行期治理是被低估的自由度——两条路不互斥,先加舱再谈微调是更省钱的顺序。
🗺️ 相关工作地图:按「你改的是哪一层」检索
| 你关心的层 | 代表工作 | 一句话定位 |
|---|---|---|
| 改提示/记忆(数字域 RSI) | Reflexion、Self-Refine、Voyager、OPRO(2023) | 语言反思、技能库、提示搜索 |
| 改数据分布 | DAgger(2011)、RoboCat(2023)、SOAR(2024)、RECAP(2025) | 自己跑出来的数据回灌训练 |
| 验证/过滤自主数据 | VERITAS(2026)、RoboClaw(2026) | 视觉验证挑好样本;采集-学习-执行一体 |
| 改执行系统/舱体 | Zetta、HarnessVLA/RPent、ASPIRE、EmbodiSkill、RoboTTT | critic/技能/恢复剧本/测试时适应 |
| 改数据 + 改执行 | EmbodiRSI、ENPIRE、Learning-While-Deploying | 部署即闭环:执行、验证、选数、更新 |
| 世界模型内递归 | RISE、Dream-RSI(2026) | 想象 rollout + 优势估计,模拟器即世界 |
| Real2Sim2Real 基础设施 | RialTo、Re3Sim、RoboTwin、GSWorld 等 | 重建/生成仿真 → 训练 → 回真实 |
| rollout 基础设施 | A3C、IMPALA、SEED RL、RLlib/Ray、RLinf | actor-learner 分离等通用思想(Z-Infra 补的是具身特有负载) |
| RSI 理论标尺 | I.J. Good(1965)、Gödel Machine、L1~L5 分级(2609.11873) | 智能爆炸 → 可证明自改 → 自主度分级 |
检索心法:拿到一篇「自我改进」的具身论文,先问三个问题——递归对象是什么(代码/数据/环境)?失败存在哪(技能库/数据集/归因网格)?验收谁来做(回归测试/隔离留出/关辅助评测)? 三个答案一定,它在上表的坐标就出来了。
🎤 汇报口述稿
30 秒版:
这两篇 2026 年的论文都在做具身系统的递归自我改进,但路线相反。Zetta 冻结 VLA,让外面的执行舱体——代码写的 critic、恢复剧本、工具——按失败证据自动进化,RoboCasa 上 73.56 拉到 93.56,全程没动一个模型参数;EmbodiRSI 反过来,从真机场景重建专属仿真,在里面用「纠错轨迹 + 弱点定向采数」递归训策略,仿真 50.4 涨到 83.5,最后只用每子任务 10 条真人纠错就以 83.1 超过 200 条真机示教的 75。一句话:一个修策略外面的执行系统,一个修策略自己的数据食谱。
2 分钟版(分四段,按需删减):
背景:递归自我改进不是新词,源头是 I.J. Good 1965 年「智能爆炸」的猜想,2023 年靠 Reflexion、Voyager 这些 LLM 工作在数字域落地,机器人这条线从 DAgger、RoboCat 一直排到 2026 年的集中爆发。
Zetta:它诊断的问题是现有 agent harness 是开环的——反思只在整局结束后发生,物理世界不等你。解法是三个时间尺度的循环:动作频率上跑轻量 critic 做当帧干预(orchestrator 裁决才准动手),rollout 批频率上做聚类和六层因果诊断,迭代频率上过「历史回归 100% + 留出 ΔSR>0」双门才把补丁写进技能包。大模型只在离线写代码,在线零 LLM 调用,所以配套的 Z-Infra 能把吞吐从 1.7 拉到 35.1 条每分钟。结果 Goal 集 34.5 到 90.8,而且学到的恢复技能零样本搬到三个新任务还带 16~20 个点。
EmbodiRSI:它的前提是「下一步需要什么数据取决于策略现在的弱点」。做法是 Real2Sim2Real:SAM3/SAM3D 把部署场景重建进 Isaac Sim,经过碰撞矫正和带物理验证的轨迹生成,得到可信沙盒;里面 rollout 监视器输出 continue/recover/complete,协作纠错从失败状态续接出矫正轨迹,自适应采集用归因网格把专家示教定向砸到弱点格子;数据带 RECAP 式优势标签回训,递归两轮。仿真 50.4 到 83.5,等预算下比静态采集高 20.6 个点,真机 83.1 超过 200 条纯真机示教的 75,物理数据只用了二十分之一。
评价:两篇最漂亮的地方是同一个——都把大模型请出执行快环,把它的智慧蒸馏成慢速可消费的产物(代码 or 数据),并且都建了防评测污染的制度。边界也很清楚:Zetta 没碰真机,EmbodiRSI 只做了场景内适配且没有组件消融。再往下走,把世界模型的想象 rollout 接进来(RISE、Dream-RSI 这条线),三种递归形态就能叠成一个完整的自改进栈。
❓ 自测 Q&A
Q1:Zetta 到底冻结了什么,又进化了什么? 冻结基座策略 π_VLA 和编排者 A_orch(连裁决函数都不变);进化的是舱体 H = {运行时 critic、恢复剧本、工具集},以代码包(SKILL.md + tools/ + plans/ + params/)的形式版本化。成功率的提升全部来自执行期知识,不是参数。
Q2:为什么用代码 critic,而不是让大模型每步盯着执行? 三个理由:① 频率——物理失效发生在亚秒级,大模型推理追不上,代码 critic 跑在动作频率;② 成本——RPent 每个决策点调 LLM API,基线单局延迟就 392~513 秒,Zetta 在线零 LLM 调用,延迟降 91%;③ 可验证——代码补丁能做「历史回归 100%」这种硬验收,模型输出只能靠采样碰运气。
Q3:回控契约 Ψ(s) 解决什么问题? 解决「恢复动作何时算完」的交接安全问题。两个合取条件——原失败证据显式清除 + 物理状态稳定(接触力 > γ)——保证策略是在一个干净、平衡的状态上接回控制权,避免恢复刚做完最抖的那一刻就把主导权还回去导致二次失败。
Q4:EmbodiRSI 的 CEC 和 ADC 分别补什么数据缺口? CEC 补**「从不完美状态出发」的续接数据**——标准示教都是从初始状态演到成功,策略真正卡住的中段没有监督;ADC 补**「弱点分布」的数据**——用归因网格找出当前策略总失败的复位格子,把采样分布往那儿压(p_{k+1} = (1-α)p_0 + α·p_hard)。一个治「状态覆盖」,一个治「配置覆盖」。
Q5:两篇分别怎么防止「考试考到原题」? Zetta:开发种子与考核种子严格不相交;留出集只许用一次,一旦为修新失败而动过舱体,被用过的种子降级为开发种子、必须换全新留出集。EmbodiRSI:训练采集的归因、复位收紧只作用于采数,测试复位完全不变;终评关闭 agent 接管、规划器恢复与人工纠正,每任务每设置独立跑 10 次真机试验。
Q6:这和普通的「多轮迭代训练」有什么本质区别? 多轮迭代的数据分布是预设的(固定数据集反复训);RSI 的数据/代码分布由上一轮自己的失败反向决定——DAgger 是最早的例子,EmbodiRSI 加了归因网格与矫正轨迹,Zetta 更进一步把「失败 → 补丁 → 验收」做成带双门的代码优化循环。「反馈决定下一步生成什么」是 RSI 的判别特征,「递归有预算上限」是它与科幻版 RSI 的分界线。
Q7:为什么说 90.8% 和 71.13% 都对? 口径不同。90.8% = Goal-T 与 Goal-S 两个扰动设置的平均(92.5 与 89.0),对应基线 34.5;71.13% = 再算上 LIBERO-10(T/S) 四个设置的总体宏平均,对应基线 32.00。头条取前者,全集是后者——引用时两个都给,才不会误判强度。
📚 资源与延伸
论文本体
- Zetta:
arxiv.org/abs/2608.16590(2026-08-17,CC BY 4.0),项目页air-embodied-brain.github.io/zetta - EmbodiRSI:
arxiv.org/abs/2609.38905(2026-09-30,CC BY-NC-SA 4.0)
顺着 Zetta 读:Harness VLA(基线 RPent,arXiv 2607.08448)、SkillOpt 与 EmbodiSkill(代码空间 SGD 式优化的来源)、REFLEXION / Voyager(数字域自我改进)、LIBERO-Pro(arXiv 2510.03827)、RoboCasa(arXiv 2406.02523)、RLinf(大规模 RL 基础设施对照)。
顺着 EmbodiRSI 读:RECAP(优势条件训练的直接来源)、SOAR(2024 自主数据采集)、DAgger(2011,交互式数据闭环的鼻祖)、RialTo / Re3Sim / RoboTwin(Real2Sim2Real 家族)、SAM 3 / SAM 3D(场景重建组件)、cuRobo / GraspGen(轨迹与抓取验证)。
RSI 主线延伸:I. J. Good《Speculations Concerning the First Ultraintelligent Machine》(1965)、Schmidhuber 的 Gödel Machine 系列、RISE 与 Dream-RSI(世界模型递归)、《The Last AI Built by Humans》(L1~L5 分级,arXiv 2609.11873)。
一句话结论:Zetta 教你把失败蒸馏成可验收的代码资产,EmbodiRSI 教你让数据采集跟着自己的弱点走;下一阶段的赢家,多半是把这两条闭环都接进世界模型想象沙盒的那一个。