📄 论文信息

第一篇:Zetta

  • 标题:Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
  • 团队:清华大学 AI 产业研究院(AIR)+ Z-Trans AI;一作 Xin Ding、Liang Mi(共同一作),项目负责人 Ting Cao(通讯),技术负责人 Xin Ding、Liang Mi
  • 发表:arXiv 2608.16590v1 [cs.RO],2026-08-17,CC BY 4.0
  • 资源:项目页 air-embodied-brain.github.io/zetta
  • 关键词:Embodied Harness、代码化 Critic、三时间尺度闭环、Z-Infra rollout 基础设施、frozen VLA

第二篇:EmbodiRSI

  • 标题:EmbodiRSI: Recursive Self-Improvement for Data-Efficient Robot Adaptation
  • 团队:Haoran Lang、Haotao Lu、Shiyu Sang(三位共同一作),通讯 Ye Shi、Jingya Wang(上海科技大学邮箱),含 Guo Chen、Qun Li 等
  • 发表:arXiv 2609.38905v1 [cs.RO],2026-09-30,CC BY-NC-SA 4.0
  • 关键词:Real2Sim2Real、递归自我改进(RSI)、协作纠错(CEC)、自适应数据采集(ADC)、RECAP 式优势标注

为什么把两篇放一起读:它们是同一思潮——递归自我改进(Recursive Self-Improvement, RSI)——在机器人上的两种落法。Zetta 冻结策略权重,认为「该进化的是策略外面那圈执行系统」;EmbodiRSI 不停改策略权重,认为「该进化的是喂给策略的数据分布」。一墙之隔,恰好互相补全。


🎯 一句话版本

  • Zetta:给 frozen VLA 套一个会自我进化的「舱外执行系统」——代码写的运行时 critic 在动作频率上盯着执行,出了偏差由 orchestrator 裁决是否触发恢复;线下把失败轨迹聚类、做六层因果诊断、生成最小补丁,通过「历史回归 100% + 留出集 ΔSR>0」双门检验后打包成版本化技能包。策略一个字节没动,成功率涨了 20~40 个百分点。
  • EmbodiRSI:从真实部署场景重建专属仿真(SAM3 分割 + SAM3D 重建 + 碰撞矫正),在这个「便宜且可重放」的沙盒里跑策略 rollout:协作纠错从策略卡住的状态生成矫正轨迹,自适应采集把专家示教定向砸向当前弱点,数据累积回训练、进入下一轮递归;最后只用每子任务 10 条真人纠错轨迹微调,真机成功率反超「200 条真机示教」的基线。

🧬 溯源一:RSI 从哪来——1965 年的一句猜想

很多同学第一次见「递归自我改进」这个词是在 LLM 圈,其实它的源头比深度学习早了半个多世纪。

1965 年,英国数学家 I. J. Good 在论文 Speculations Concerning the First Ultraintelligent Machine(Advances in Computers 第 6 卷,Academic Press)里写下那段著名推演:如果一台机器能设计出更好的机器,那么「智能爆炸」(intelligence explosion)就会发生——机器的最后一次发明,就是造出比自己聪明的后代。这段话后来被反复引用(千次量级的高被引),也是「技术奇点」叙事的文本源头。Good 当时关心的是机器改进机器这个递归结构本身,而不是具体哪种算法。

沿着这条线,改进的对象换了三拨:

  1. 改进「程序」:Schmidhuber 1987 年的可递归自改进系统、2003 年的 Gödel Machine(证明「改动对自己有益」后才允许自我修改)、PowerPlay(不断发明新技能的搜索)——这一支把 RSI 变成了可证明的搜索问题。
  2. 改进「提示与技能库」:2023 年 LLM 火了之后,Reflexion(语言化反思写进记忆)、Self-Refine(自我批评再自我修订)、Voyager(把可执行技能库越滚越大)、OPRO(用 LLM 优化提示词)让「执行 → 评估 → 反思 → 更新」这个循环在数字世界便宜地跑了起来。这一波就是 Zetta 相关工作里点名的数字域 RSI。
  3. 改进「策略与数据」:机器人领域起步更早但更慢——2011 年 DAgger 就示范了「让当前策略自己去跑、专家在旁边纠正、纠正数据回灌训练」的交互式数据闭环;2023 年 RoboCat 用自我生成的示教跨任务累积改进;2024 年 SOAR 让基础模型自主采数据、从无标注经验中学习;2025 年 RECAP 把示教、自主经验、纠错反馈用「优势条件」缝进同一个训练目标。到 2026 年,这条线集中爆发:VERITAS(视觉验证过滤自主 rollout)、RoboClaw(采集-学习-执行一体化)、RISE(世界模型内想象 rollout + 优势估计)、EmbodiRSI 与 Zetta。

RSI 家谱:从 I.J. Good 1965 到 2026 年具身 RSI 的两条赛道

上面这张自绘时间线把两拨先驱画在一起:上半是数字域 RSI(改程序/改提示),下半是机器人 RSI(改数据/改执行系统)。2026 年的四篇代表作里,EmbodiRSI 和 Zetta 各守住一个岔口——这也是本文只精读这两篇的原因:它们不是同一方案的重复,而是同一条思想树上的两根主枝。

补一个当下坐标:arXiv 2609.11873《The Last AI Built by Humans》把自主改进系统分成 L1L5 五级(从「人设定改进循环」到「机器自己定义目标与评估」)。按它的标尺,Zetta 和 EmbodiRSI 大约处在 L2L3:改进循环是人预设的,但循环里跑什么完全由系统自己的失败证据决定。


🏷️ 溯源二:Zetta 的名字,和「Harness」这个词的来历

Zetta 是国际单位制前缀,10²¹(千的七次方),挨着我们在存储容量上熟悉的 exa/peta;论文里用希腊字母 ζ 做符号。选这个量级的词,姿态很明显:接续 Z-Trans AI 自家的 Z 系列(论文基础设施直接叫 Z-Infra),并暗示目标是把「物理智能」当成可随经验积累而指数增长的量来经营。同组系统里还出现过 Z-Harness 的叫法——Z 家族的「舱」。

Harness 本身不是新词,它的迁移路径值得捋一遍:

阶段harness 指什么典型场景
软件工程测试挂具:被测程序外面那圈负责喂输入、抓输出、判对错的脚手架单元测试、CI
LLM Agent 时代Agent 挂具:把模型接进终端/浏览器/评测集的外壳(跑命令、收日志、打分)SWE-bench、Terminal-Bench 类系统
具身时代(本文)Embodied harness:包在 frozen VLA 外面的运行时感知 + 干预 + 恢复系统Zetta、HarnessVLA 等

所以「harness」这个词选得准:它是外面那圈不负责自己做任务、只负责让里面的模型把任务做稳的东西。软件测试 harness 判程序对错,具身 harness 判「这次抓取的物理状态还对不对」,不对就干预。论文引的同代工作 Harness VLA(arXiv 2607.08448,即其对比基线 RPent)把记忆引导的 agent 接到 frozen VLA 上,正是这条线的另一支。

读这两篇前的术语表(后文直接使用):

术语含义
VLAVision-Language-Action 模型:看图 + 指令直接输出动作的策略
frozen / 冻结推理时权重完全不更新,Zetta 全程如此
WAMWorld Action Model,世界动作模型(论文里与 VLA 并列的另一类基座)
LIBERO-Pro抗记忆化的 VLA 基准(arXiv 2510.03827),含 Goal-T/Goal-S 扰动与 LIBERO-10 两组设置
RoboCasa大规模日常任务仿真基准(arXiv 2406.02523),本文用其 18 个 Atomic-Seen 任务
π0.5 / GR00T N1.5分别是 LIBERO-Pro 与 RoboCasa 上的 frozen 基座策略(Physical Intelligence / NVIDIA)
RPentZetta 的主要 agent 基线,来自 Harness VLA(ref [5])
RSIRecursive Self-Improvement,递归自我改进
R2S2RReal-to-Sim-to-Real,真实观测建仿真 → 仿真里改进 → 回真实部署
ALOHA双臂低成本操作平台,EmbodiRSI 用 14 自由度版本

🧩 Zetta 深拆:把「反思」从 episode 之后搬到动作之间

1. 它到底在解决什么问题

论文开篇点的病灶非常具体:现有具身 agent harness 是开环的。执行开始后,agent 要么按固定技能走,要么按预设轨迹走,反思只发生在一整局结束之后(post-hoc reflection)。问题是物理交互不等人——抓取滑脱、接触丢失都发生在亚秒级,而大模型 agent 的推理频率根本追不上。于是形成一个尴尬错位:

大模型负责「想」,但它想得太慢;小模型/代码负责「动」,但没人教它什么时候该喊停。

论文把挑战拆成三条:

  1. 开环的语义-物理鸿沟:frozen 基座模型语义理解在线,但对物理状态漂移无感知,一局之内不会自我纠正。
  2. 过度参数化修复的泛化陷阱:直接调基座权重去修某个失败,等于用一个高维旋钮对准一个低维病灶,改完这个种子坏那个种子——所以 Zetta 宁可不动权重。
  3. 专家在环调试不可扩展:人工看日志改代码,人力是天花板,必须自动化。

对应的三条设计原则:高频状态治理(在动作频率上布署轻量 critic)、自顶向下分层因果诊断做最小干预(原话是「若高层逻辑能解决,绝不改低层参数」)、自动化进化泛化(把种子级修补抽象成机制级不变量,再用留出集验收)。

2. 形式化:双智能体治理 + 可进化舱体

Zetta 把系统切成「固定部分」和「可进化部分」:

  • 固定:基座策略 π_VLA(或 WAM)与编排者 A_orch(Orchestrator)——连决策函数都不许变,防止单位点漂移;
  • 可进化舱体 H = {C, R, T}:
    • C(Critics):高频运行时监视器,输出结构化提案 P_t(哪里不对、证据是什么);
    • R(Recovery):恢复剧本——发现问题后怎么把系统拉回可控状态;
    • T(Toolset):可执行工具与算子(规划器、抓取检测器、恢复模块),会被生成、实例化、替换,而不只是调参。

裁决逻辑(论文式 3):执行中每一步的模式 σ_t 由编排者裁决:

sigma_t=A_orch(P_t,R,T,K)

σ_t = 0 表示继续走 VLA/WAM,σ_t > 0 表示切换到专用工具。K 是任务知识(预定义里程碑、成功判据、环境约束)。注意这里的关键约束:critic 高频提议,但只有证据被编排者接受才允许干预——既避免了「大模型每步都在环里」的延迟,又避免了「critic 一惊一乍」的误触发。

优化目标(论文式 5):

max_HJ(H)=E[Success(tau)|pi,A_orch,H]

即:在 π 和 A_orch 不动的前提下,只优化舱体配置,让期望任务成功率最大。

Zetta 总览:frozen 策略外面套一个会进化的舱,闭环靠三个时间尺度的循环驱动

Fig.1(论文第 1 图)四件事:① 高频运行时 critic 在执行中触发恢复;② 经验证的失败被蒸馏成可复用的 critic 与恢复技能,跨 rollout 复用;③ 硬件解耦的 rollout 层把这套流程铺到异构环境/模型/CPU/GPU 上;④ 由此得到持续同任务改进、零样本技能迁移、机器人「Aha Moment」和执行加速。

自绘架构:左侧在线执行闭环(动作频率),右侧离线三阶段进化循环(迭代频率)

上面这张自绘图是全文骨架:左边是在线环(rollout → critic 提议 → orchestrator 裁决 → 恢复/回控),右边是离线环(Phase I 失败画像 → Phase II 诊断修复 → Phase III 合并打包),中间靠「验证门」交换信任——离线产出的舱体补丁必须过门才能回流在线。两个环的频率差就是论文的核心设计变量:在线环跑在动作频率,离线环跑在迭代频率。

Zetta 进化框架总览:左半在线并行 rollout,右半 Reflection & Evolve 三阶段

Fig.2 逐栏拆解:

  • 左(Parallel Rollouts):动作策略执行任务,Evolvable Harness(H = C/R/T)在其上监控,Orchestrator 做高层裁决;rollout 结束按成败分成成功/失败两类轨迹。
  • 右(Reflection & Evolve):失败轨迹触发离线三阶段——Phase I 把失败对成功基线做聚类画像;Phase II 做因果诊断定位根因层 L*,随后做最小舱体修复(更新 C、R、T);Phase III 把种子级补丁泛化成统一的版本化舱体包 H_merged,再喂回执行循环。

3. 三个时间尺度的循环(论文的灵魂)

循环频率干什么让系统获得什么
Loop 1:Critic-Governed Action Loop动作频率学到的 critic 随每步执行跑,必要时调用对应恢复技能闭环执行(当帧干预)
Loop 2:Rollout-Batch Candidate Optimization Looprollout 批频率对每次迭代的失败做聚类、诊断,提出候选 critic 与 recovery自进化(提出补丁)
Loop 3:Validation-Gated Skill Update Loop迭代频率只放行「提升成功率且跨 rollout 泛化」的候选,写入技能记忆自进化(验收补丁)

有个容易忽略的细节:Loop 2 里没有梯度可下降——技能和代码不提供梯度。论文明确借用了 SkillOpt 与 EmbodiSkill 的思路,构造一个 SGD 式的代码空间优化过程:诊断相当于「算损失」,修复补丁相当于「一步更新」,验证门相当于「验证集早停」。把 LLM 写代码的过程类比成梯度下降,是这套方法论最好玩的一步棋。

4. Phase I:失败画像——先把病历写规范(Loop 1 落地)

Phase I 的产出叫失败种子清单 M_fail,靠三件套:

  • 确定性调度与执行协议:同种子、同随机性地重放,保证证据可比;
  • 多维证据采集:不止看最终成败,还采过程证据;
  • 分类与索引:给每条失败轨迹挂上结构化标签。

它回答的问题朴素但关键:不是「它失败了」,而是「它从哪一步开始不像成功的样子」。

5. Phase II 第 1 步:聚类 + 诊断——按「最早偏离点」分类

机制级失败聚类。论文拒绝按最终结果做表面分类,改用 Earliest Observable Divergence(EOD):在轨迹里找第一个偏离「健康分布」的时刻(论文式 10):

t_EOD=min{t:dist(s_t,s_ref_t)>eps,s_ref_tinI_succ(mu_t)}

配合 第一个缺失的里程碑 m*、机器人-物体相对位姿、活跃工具 ID,把 M_fail 切成互斥的失败簇 {K_1…K_n}。再给每个簇挑一个medoid seed(特征空间里离簇心最近的样本)作为深度诊断对象——等价于「不修平均病例,修最有代表性的病例」。

单视图接地观察协议:为防多模态模型在多视角之间「幻觉空间关系」,诊断只锚定一个主视图——这是对 VLM 老毛病的工程性防御。

自顶向下六层因果诊断(论文式 11)。对选定种子按固定优先级逐层排查,找最高优先级的根因层 L*:

层序层检查什么
1Evaluation成功判据/里程碑逻辑本身写错了?
2Critic运行时 critic 漏报(false negative)或误报(false positive)?
3State物体位姿/接触信息偏离物理真值?
4Planning状态正确但策略/工具没处理好物理约束?
5Recovery失败发生在恢复过程中——恢复剧本本身有缺陷?
6Parameter具体控制增益、动作阈值的问题?

「从上往下修,能不动参数就不动参数」这条纪律,保证了补丁落在最小有效层,基座模型完整性不受侵蚀。诊断完还要在簇内其他成员上验证机制一致性,最后输出修复候选规格:定位的层 + 因果证据链 + 对 (C, R, T) 的功能需求。

6. Phase II 第 2 步:最小修复 + 「回控契约」

修复由 Repair Agent A_repr 执行,产出补丁 H_patch = {C*, R*, T*}:

  • Critic Enhancement:开发或细化高频监视函数,捕捉该失败的前兆条件(而不是事后症状),偏差时生成结构化提案;
  • Recovery Drafting + Tool Adaptation:写恢复剧本、适配或合成可执行工具。

其中最值得抄的一个设计是 VLA 回控契约(Re-entry Contract,论文式 12)——恢复不是「做完就还手」,而是要满足一个显式谓词才准把控制权交还 frozen 策略:

Psi(s_t)=1(FailureCleared)AND1(Stability(s_t)>gamma)

两个条件缺一不可:当初的失败证据被显式清除(防「带着病交接」),且物理状态达到平衡(接触力稳定,防在抖动瞬间回控)。这本质上是把分布式系统里的「两阶段提交」思想搬进了机器人控制权交接:恢复动作最危险的时刻往往不是失败当下,而是交接那一瞬间——早一帧回控,策略就会在坏状态上继续作死。

修复后还有闭环验证协议:诊断性重放(对着原失败证据确认修复有效)+ 新鲜 rollout(确认不是过拟合某条轨迹),两步都过才算修复成功。

7. Phase III:合并、打包、双门验收——补丁如何变成资产

Generalization Agent A_gen 干的是「从个案到通则」的活:

  • 机制合并:把一个失败簇内多条验证过的补丁做 OR-merge,抽成机制级不变量,得到统一舱体 H_merged;
  • 打包外置(保证可移植与版本管理):
    • SKILL.md:高层治理逻辑——里程碑 M、编排者裁决规则、泛化的回控谓词 Ψ;
    • tools/:进化后的 critic 与工具集的可执行实现;
    • plans/:泛化的恢复剧本;
    • params/:参数化配置。

双门验收(防自嗨的两道闸):

  1. 历史回归(论文式 15):新舱体必须对原失败簇内所有种子达到 100% 成功率——一个都不许漏;
  2. 留出评估(论文式 16):在严格隔离的留出集上算成功率增量 ΔSR = SR(D_held-out | H_merged) − SR(D_held-out | π_VLA),必须为正。

动态转场协议更狠:如果留出集暴露出新的失败机制、逼着你再去改 H_merged,那么这个被「污染」的留出种子会被降级为开发种子,必须重新领一份从未见过的留出集才能结束本迭代。翻译成人话:验收集只许用一次,用过了就不干净了。 这是对「一边刷留出集一边迭代」这一常见学术操作的制度性封堵。

8. Z-Infra:把 rollout 吞吐当成智能的限速器

论文有句很漂亮的论证:环境是学习数据的来源,rollout 越快,进化越快——所以吞吐就是自进化智能的限速器。 为此他们专门做了 Z-Infra(自称首个为自进化具身智能体设计的 rollout 基础设施),架构见下图:

Z-Infra 三层架构:Control Plane 路由请求到 Env Worker 与 Rollout Worker

Fig.3 三层分工:

  • Control Plane(控制面):接收 agent 的虚拟 rollout 接口请求(「执行什么」),负责路由、会话管理;
  • Env Worker 层:管环境模拟——CPU 型仿真(MuJoCo/robosuite 逐会话维护状态)、GPU 并行仿真后端、渲染,各有各的生命周期与资源组;
  • Rollout Worker 层:管模型推理——调度器、模型切分(VLM 与动作专家分开放)、量化运行时、动态批处理与异步调度。

它要同时解决两个麻烦:资源异构(一次 rollout 里既有微秒级 CPU 算子、又有吃显存的自回归/扩散动作生成、还有 CPU 密集的物理步进,单一资源池和调度策略都不适配)和执行动态性(agent 动态决定调哪个工具,这一步可能只调策略、下一步连着感知规划一串,会话创建/暂停/销毁完全不规律——静态分配必然浪费)。解法是解耦抽象层:agent 只说「做什么」,基础设施管「在哪做、怎么做」,加机器不改 agent 代码。

性能数字(Z-Infra 实验,8×A100,LIBERO Goal,并发 1/8/16/32/64):

  • 吞吐:RPent 1.72 条/分 → 自家无 Z-Infra 2.88 条/分 → 有 Z-Infra 并发 8 时 12.18、并发 16 时 22.09(7.7× vs 无 Z-Infra,12.8× vs RPent)、并发 32 时 32.8、并发 64 饱和在 35.1 条/分(20.6× vs 基线起点 1.7);
  • 延迟:Z-Infra 单局延迟并发 8→32 只从 39s 涨到 57s(+46%),并发 64 才到 95s;自家无 Z-Infra 则从 34s@8 直接爆到 112s@16;RPent 因为每个决策点都要调 LLM API,基线就高得离谱(392s → 513s);两个基线在并发 16 以上直接 OOM;
  • 端到端:对比 RPent,推理延迟 −91%(11.1× 加速),单局延迟 11.9×。

这里有个设计上的清醒:大模型只在离线 Reflection & Evolve 阶段出现,在线 rollout 全程是「纯 VLA + 轻量运行时 critic」。这正是 Zetta 对「大模型在环延迟」问题的正面回答——不是把大模型调快,而是把它请出执行环,只留下它产出的代码站在环里。

9. 实验:两套基准、两条泛化协议、8×RTX 4090

实验设置(论文 4.1 节):8 张 RTX 4090 做并行 rollout 与离线进化;LIBERO-Pro 用 π0.5 做 frozen 基座,RoboCasa 用 GR00T N1.5;全程不微调基座权重。两套基准各配一条严格隔离的泛化协议:

基准开发集进化循环最终考核(held-out)
RoboCasa(随机分布泛化)每任务随机采 50 个环境种子每轮收失败轨迹、按失败签名聚类、取 medoid 种子诊断修复另一拨严格不相交的 50 个种子
LIBERO-Pro(开发-测试泛化)每任务 50 个父种子(排除种子 1~20)聚类后针对最大失败簇的错误种子修复,开发种子成功率 ≥50% 即停只考种子 1~20

主结果一:RoboCasa 18 任务(论文 Table 2)——宏平均从 frozen 基座的 73.56% → 93.56%(+20.00pp),四轮全局修复的爬坡轨迹是 73.56 → 78.71 → 84.85 → 90.54 → 93.56。因为 VLA 全程冻结,这 20 个点全部是舱体里验证过的执行知识的积累,不是模型容量换来的。

主结果二:LIBERO-Pro 40 组任务-设置(论文 Table 3)——总体宏平均 32.00% → 71.13%(+39.13pp),分项:

设置frozen π0.5Zetta增量
Goal(T)任务/指令重定向31.092.5+61.5
Goal(S)交换/位置互换38.089.0+51.0
LIBERO-10(T)50.063.0+13.0
LIBERO-10(S)9.040.0+31.0

40 组里 32 组提升、8 组持平、零组变差。论文摘要里的头条数字 34.5% → 90.8% 就是 Goal(T) 与 Goal(S) 两个设置的平均((31+38)/2 = 34.5 → (92.5+89)/2 = 90.75)——读这类论文要小心口径:只算 Goal 扰动集很好看,算上 LIBERO-10 的整体是 71.13%,两者都真实,但用途不同。

LIBERO-Pro Goal-T 十任务累积进化曲线

LIBERO-Pro Goal-S 十任务累积进化曲线

Fig.6a/6b(累积进化曲线):横轴是「选定的累积舱体版本」,纵轴是十任务平均成功率,两条曲线分别对应 Goal-T 与 Goal-S 扰动。每个点只代表舱体在长大、VLA 没动。 曲线形状值得注意——不是匀速爬坡,而是「平台 → 跳变 → 平台」,这正是下一段 Aha Moment 的宏观投影。

10. Aha Moment:平台期之后的跳变

论文把「停滞很久然后突然拉起」定义为 Aha Moment,并强调这些 checkpoint 是离线诊断过程中的内部版本(v0→v1→v2),既不是新 rollout 轮次也不是 VLA 训练:

  • LIBERO-Pro Goal-T2(把瓶子放进碗):v1 加了「预抓取 staging」改善接近几何,成功率只有 10%→15%(停滞,因为没解决运输途中丢物体);v2 真正定位瓶颈是抓取保持,加了一个「运输前验证持物稳定性」的 critic,直接跳到 95%;
  • Goal-T8:v1 微升 5%→10%(弱抓取没解决),v2 用恢复技能盯住「接触-抓取-保持」全序列,拉到 60%;
  • Goal-S6(放奶油奶酪):v1 修「释放门」只治了晚期症状(5% 停滞),v2 把注意力挪到接近阶段缺乏语义进展,一个校准过的语义抓放恢复同时解决接近/抓取/运输三段,冲到 90%;
  • RoboCasa:TurnOnElectricKettle 88%→94%(顿悟是「末端执行器简单重对齐就能恢复 VLA 期待的几何」)、SlideDishwasherRack 76%→94%(关键是接触丢失后重建居中接触)、CloseToasterOvenDoor 82%→96%。

聚合数字:Wine Bottle in Bowl 15% → 95%、Put Cream Cheese on Bowl 5% → 90%。论文由此提出一个很有力的论断:物理智能的可扩展单元不是轨迹,而是「状态变量的识别」——抓住「抓取稳定性」「接近几何」这类任务无关变量,一个 critic 就能救活一整片失败。

11. 零样本技能迁移:改一个任务,救活三个任务

这是我认为全文最漂亮的实验设计。源任务上累积出的三件套,不加任何目标任务优化直接搬过去:

PnP 任务:源任务 PnP-Stove 三轮进化 + 向三个目标任务的零样本迁移

Fig.10(Pick-and-Place 线):源任务 PnP-Stove 78% → 84%(预抓取对齐)→ 94%(抓丢后重抓)→ 96%(稳定放置);把这套累积栈零样本投到三个目标任务:

迁移目标Pure VLA 基线迁移后
PnP-Sink58%82%
PnP-Cabinet62%80%
PnP-Toaster72%90%
宏平均64%84%(+20pp)

铰接交互任务:源任务 TurnOffStove 三轮进化 + 向三个目标任务的零样本迁移

Fig.11(铰接交互线):源任务 TurnOffStove 74% → 82%(目标旋钮接管)→ 84%(预接触)→ 92%(稳定接触);右侧三格配图是三轮演进的失败→恢复对比——「转错旋钮 → 定位对的旋钮」「接近没对准 → 对准」「接触不稳 → 稳定接触」。迁移结果:

迁移目标基线迁移后
TurnOnSinkFaucet74%90%
OpenCabinet62%78%
TurnOnMicrowave56%72%
宏平均64%80%(+16pp)

两次迁移的共同点:被复用的技能全都作用在任务无关的物理量上(末端对齐、接触稳定、持物保持),而不是记住了源任务的轨迹。LIBERO 上也有同样的实验(Fig.7 以 Goal-T8 为源迁到 T2/T6/S3,其中 Goal-S3 从 9/20 → 20/20;Fig.8 以 Goal-S5 为源)。

12. 两个案例研究:一次 aPnP 的连续干预,与失败边界的推进

RoboCasa aPnP 回合中的 critic-recovery 干预序列

Fig.12:VLA 先抓起并搬运物体 → 一个 critic 检测到抓取丢失、触发重接近恢复 → 恢复里发现重抓位姿无效,调用 GraspGen 合成可行抓取位姿 → 接近目标时,最后一个 critic 调用稳定放置。一个回合里三次不同层级的干预,展示了 C/R/T 三件套如何接力。

LIBERO-Pro Goal-S5:promotion 轮次逐步推进失败边界

Fig.13:父 VLA 在 Goal-S5 上耗尽执行预算也等不到及时的恢复交接;随后每一轮 promotion 加一件装备——持物门控交接 → 接触门控抓取恢复 → 有界重抓重试——每件新增装备都消灭一类残余失败,「失败边界」被一轮轮往外推。这张图是「累积进化」最直观的诠释:不是换更强的模型,是给同一个模型逐件配齐安全带。

13. Zetta 的边界(读完必须记住的三条)

  1. 全程仿真验证,没有真机。所有成功数字来自 LIBERO-Pro 与 RoboCasa 模拟器;critic 读的接触力、物体位姿在真机上要么传感器没有、要么有噪声,移植时「单视图接地 + 状态证据」的假设要重做。
  2. 任务知识 K 是人给的。里程碑、成功判据、可接受的接触阈值 γ 都预置在 SKILL.md 里——进化优化的是「怎么达到你定义的成功」,不是「什么算成功」。
  3. 「under our current rollout budget」这个限定词作者自己反复出现。曲线仍在上涨意味着数字未饱和,但每一分提升都以大规模并行 rollout 为代价(这正是他们要做 Z-Infra 的原因),复现成本不低。

🤖 EmbodiRSI 深拆:让「要采什么数据」跟着「现在哪里失败」走

1. 它在解决什么问题

具身策略适配新任务/新环境太吃数据,而论文点出一个循环依赖:下一步最需要的数据,取决于策略现在的失败模式——策略变了,弱点就变了,固定分布采一批数据用到底的做法天然低效。EmbodiRSI 的回答是把改进做成递归:每轮 rollout 的反馈,直接决定下一轮采什么数据、生成什么矫正轨迹。

EmbodiRSI 总览:真实观测建仿真 → 仿真内 RSI 循环(CEC + ADC)→ 少量真机 HIL 微调后部署

Fig.1(论文第 1 图)读法:真实观测 + 任务目标 → 构建可执行仿真环境与经过验证的示教;在这个环境里,rollout 反馈驱动两条互补通路——协作纠错(CEC)与自适应数据采集(ADC);产生的经验更新策略进入下一轮,形成递归循环;最后用一小份**真人在环(HIL)**数据集微调,得到可自主部署的策略。

自绘:EmbodiRSI 的 R2S2R 大循环——建环境、RSI 递归、再回真实世界

自绘大图强调递归预算这一点:R0/R1/R2 三轮用 50/200/400 条保留仿真轨迹,轮数和配额预先固定——反馈只决定「预算内怎么花」,不决定「花多少」。这是系统与「无限自改进」幻想的分界线。

2. 第一环:把部署场景变成可执行仿真(Real2Sim)

对象级重建:VLM 先在输入图里认出桌子和可见可动物体 → SAM 3 出实例掩码 → SAM 3D 重建带纹理网格,场景表示为 S_0 = {桌子 o_T, 物体 o_1…o_N},每个物体带语义类别、网格与 SE(3) 初始位姿(论文式 B.1)。物体身份贯穿场景编辑与轨迹生成全程——指令说的「遥控器」和几何检查、机器人程序里的遥控器必须是同一个对象。

场景管线:编译可执行初始场景 + 迭代精化面向任务的布局

附录场景管线图分上下两段:

  • (a) 编译可执行初始场景:观测重建 → 支撑感知碰撞矫正(AACR) → 验证过的工作区 S_0。AACR 又分两步:**PHR(并行水平矫正)**把相交的物体组当整体向外分离,保住组内关系、只对扫掠区不相交的组并行批量处理;**AIR(组内自适应矫正)**按物体关系选算子——同支撑面的用水平分离、包含关系用垂直调整、插入式排布用有界倾斜。语义推理决定用哪个几何算子,碰撞检查负责验证,两者不互相替代。
  • (b) 精化任务导向布局:渲染三视图(正/顶/侧)检查 → 场景智能体先提粗关系(在…上面/里面/旁边)再做逐物体位姿精修 → 批评-验证环节检查支撑、碰撞与任务关系,不接受就要求可执行的位姿编辑、再渲染;接受后得到初始/组织后场景对 (S_0, S_org),两者的差异就是物体级操作目标。

场景智能体的批评-调整闭环:指令 → 生成 → Critic 打分 → Adjustment 出位姿编辑

批评-调整闭环配图更直观:语言指令(“Please tidy up the desk”)+ 目标布局图 → 3D 场景生成 → Critic Agent 重渲染并打分(示例输出 "score": 76, "pass": false, "issue": "Remote outside tray",反馈「把遥控器挪到托盘中心」)→ Adjustment Agent 产出结构化动作 JSON(screen_translate、rotate_deg、snap_to_table)→ 更新场景状态(物体表、坐标系约定、正/顶/侧视图)→ 打分通过则落定为 Final Scene。场景构建本身就是一个带批评器的 agent 循环,和 Zetta「critic + 修复」的形制遥相呼应,只不过这里修的是场景而不是执行。

重建与组织示例:移动相机/机器人相机观测 vs 重建,及任务导向的目标关系

重建示例图给了三种输入来源的重建质量直觉(移动相机实拍、机器人相机实拍),下方是任务导向组织:初始布局 → 目标布局,示例目标关系如 “Remote into tray"“Mouse onto pad”——注意图里那行小字:这些是轨迹生成的输入,不是对重建质量的评测。附录还有更大画廊(含网页图、AI 生成图输入):

重建画廊:移动相机/网页图/机器人相机/AI 生成输入的输入-重建对

画廊按输入来源分四行(移动相机、网页图、机器人相机、AI 生成),每格都是 Input vs Reconstruction 对照,底部标注**「仅定性示例;外部与合成输入不计入基准试验」**——对「拿好看的重建图当定量结果」防得很严。

轨迹智能体:把场景对编译成可执行任务配置与验证过的示教——先提物体空间路线,经 GraspGen 投出抓取候选,再用 cuRobo 校验完整机器人程序;准入条件包括扫掠体碰撞检查、多视角复核、顺序运动可行性、执行时任务检查,不合格的修复重验或直接拒绝;存储的 waypoint 锚定在源/目标位姿上。这一步等价于给仿真环境配了一个不发假数据的出纳——进训练集的每条示教都先过物理验证。

3. 第二环:仿真内的 RSI 循环(方法核心)

EmbodiRSI 的 RSI 循环:rollout monitor → 协作纠错 → 自适应采集 → 优势感知训练

上图就是论文 Fig.2 的完整信息流,四个模块顺时针转:

① Agentic Rollout Monitor(论文式 1)。监视器 agent 融合时间图像窗口 + 动作历史 + 仿真器物体/机器人状态,输出三选一决策:

y_t=A_RSI(o_{t-w:t},x_t,a_{1:t},l),y_tin{continue,recover,complete}

视觉证据负责识别抓空、打滑、放错位置;程序化检查量测目标-物体误差与夹爪状态;完成判定要求视觉决策与几何成功同时成立;恢复请求要过四道闸——置信度、冷却期、尝试预算、持物测试(防止打断正在进行的有效搬运)。所有决策连同配置 ID、场景状态、失败证据一起落日志。注意一个刻意设计:仿真器的物体位姿只用来支撑这些监视/训练工具,不喂给被学习的策略——评测时策略的输入仍是纯 RGB + 本体感觉 + 指令。

② Collaborative Error Correction(CEC,论文式 2)。核心原则一句话:恢复必须从策略实际到达的状态把任务做完,而不是从初始状态重放一份干净示教。 触发时刻 t_f,把标称抓取位姿通过物体位姿变换搬到现在的位置:

T_g^cur=T_o^curinverse(T_o^0)T_g^0

候选配置按确定顺序试探但不推进仿真;入口运动从当前关节状态规划,目标重新锚定到当前场景;诊断与规划期间仿真时钟暂停。纠正完成后刷新观测、检查完成、满足恢复闸再把控制权交还策略。这套机制的红利有两层:回合内它救命(失败状态被拉回来),回合外它产数据——成功续接的轨迹提供了「从不完美状态出发」的动作监督,正是标准示教里最缺的那一段。

③ Adaptive Data Collection(ADC,论文式 3、4)。把采集分布对准当前策略的已诊断弱点:

  • 每轮采集后,agent 把最终失败归因到「源物体复位」「目标锚复位」或「都不是」;归因可缓存复用,不重复调 VLM;
  • 把复位位置归一化到网格,算归因失败率 r̂ = U/N(分母是该格完成且位置有效的监控回合数,分子只计有支撑归因的最终失败——经恢复成功的回合不进分子,这套统计描述的是「辅助采集」而非「无辅助测试」表现);选格要求:观测与归因失败都够量,且失败率超过该主体的全局失败率;
  • 选中的格映射回世界坐标,收紧对应复位范围(支持够时连朝向一起收);随后按混合分布采新示教:
p_{k+1}(c)=(1-alpha)p_0(c)+alphap_hard,k(c),0<=alpha<=1

p_hard,k 把采样集中到已诊断的弱配置,p_0 保证 α<1 时原始分布仍可达;且该精化只作用于训练采集,测试时复位完全不动——防止「考题跟着复习范围走」。

④ 数据累积与策略更新(论文式 5~7):

DAL___{tpki+=1=}R_E=t[D+l__kVB(Cuo(n_i{potin+_ntD}h_,ekt^lar)(o.l-lVu(no_i_tot,n,lDl,_)k,z^_ntez)w_,ta=_t1[)A_]t>delta]((ee(qqeq56,,7)eRaEcChAPe-psitsyoldee)countedonce)

实现里 R_t = 0、n = 50,二值标签完全由价值估计的变化决定;优势标签以文本条件的形式喂给动作预测,记录的动作仍是监督目标。价值模型与策略共用同一视觉-语言骨干(同检查点初始化)加价值头。外层由 OpenClaw 监督者经 MCP 接口协调整个 RSI 工作流,智能体系统基于 GPT-5.5,仿真平台为 Isaac Sim。

Algorithm 1 把流程收成 12 行:建仿真 → 采 D_0 训 π_0 → 每轮(rollout + 诊断 + 符合条件的状态条件恢复 → 保留 D_k^roll → 归因失败按式 4 形成 p_{k+1} → 在 p_{k+1} 下生成验证过的 D_k^new → 按式 5~7 累积、标注、训练 π_{k+1})→ 少量真机 HIL 微调 → 只用学到的策略独立评测。最后这句是防作弊关键:终评关闭 agent 接管、规划器恢复与人工纠正——测试时的重试也只能是策略自己学会的行为。

4. 实验:三个场景、14 个子任务、一台双臂 ALOHA

设置:14 自由度双臂 ALOHA(两个腕部相机 + 一个头相机,仿真观测与之对齐),配对工作区 S1 办公桌(6 子任务)、S2 厨房桌(4)、S3 家务桌(4),每场景一个策略;R0 从 π0.5 检查点初始化;R0/R1/R2 分别保留 50/200/400 条仿真训练轨迹/子任务;HIL 阶段再加每子任务 10 条真人纠错轨迹;所有测试纯策略、无外部恢复,真机每任务每设置 10 次试验;汇总用场景均衡均值。

真机与仿真配对场景:S1 办公桌 / S2 厨房桌 / S3 家务桌

Fig.3 上排真机工作区、下排对应仿真环境,逐列同场景——「配对」是全文可信度的地基:仿真里改进的每个子任务,真机上都有同定义的考题。

结果一:递归轮次自身在涨(论文 4.1 节)。场景均衡仿真自主成功率 50.4%(R0)→ 70.7%(R1)→ 83.5%(R2),14 个子任务全部从 R0 涨到 R2(例如 S1 黑笔放置 14.0% → 76.5%)。质性观察与两条反馈通路吻合:早期策略抓空后仍继续搬运,后期抓取更稳、且会主动重试无效交互(部分重试直接完成任务);50 条示教初始化时策略还会混淆红帽记号笔与红笔的指令,预算加大后这种指令混淆不再复现,残余错误转为纯执行错误。

结果二:等预算对比——自适应 vs 静态(论文 Table 1,S1+S3,400 条/子任务):

方法仿真R2S2RR2S2R + HIL
EmbodiRSI w/o RSI(静态采集)59.346.367.9
EmbodiRSI79.959.282.1
增益+20.6+12.9+14.2

同样 400 条数据,数据怎么来的造成 20 个点的仿真差距;而且这优势穿过真人微调仍然保留(+14.2pp)——不是「仿真里自嗨、回真机清零」。

结果三:数据效率(论文 Table 2,真机,场景均衡):

训练设置S1 办公S2 厨房S3 家务场景均衡
R1(200 仿真条)43.360.052.551.9
R1 + 10 HIL63.382.575.073.6
R2(400 仿真条,零样本上真机)53.370.065.062.8
R2 + 10 HIL81.785.082.583.1
纯真机示教 10 条13.345.020.026.1
纯真机示教 100 条56.762.552.557.2
纯真机示教 200 条70.077.577.575.0

头条数字由此而来:400 条仿真 + 每子任务 10 条真人纠错 = 83.1%,打赢「每子任务 200 条纯真机示教」的 75.0%——物理轨迹用量只有对方的 1/20。 另注意 R2 零样本上真机已有 62.8%:仿真里递归出来的能力确实能直接搬过物理-仿真鸿沟,HIL 只是修残差(例如 S1 红笔放置 R2 前固定 2/10,HIL 后 7/10;而眼镜放置 HIL 前就已 10/10)。

真机执行对比:纯真机 200 条 vs EmbodiRSI 400 仿真 + 10 HIL

真机执行示例图给的是两种训练配方下的执行对比:左侧纯真机 200 条示教、右侧 EmbodiRSI 配方(400 仿真 + 10 HIL),配合论文描述可归纳两类典型差异——抓取对齐的一致性与失败后重新尝试的能力(后者是 CEC 在仿真里反复喂「从失败状态续接」数据的直接产物)。

结果四(隐含的反面教材):窄开口放置类子任务在两种配方下都会暴露近接触误差(笔放不进笔筒),但论文也诚实指出受约束放置并不注定失败——这类「难任务」正是 ADC 归因网格最该盯的地方。

5. EmbodiRSI 的边界(论文 Limitations + 我们补的两条)

  1. 只验证了场景内适配:没有留出工作区(held-out workspace)实验,跨场景泛化未检验;
  2. 系统级研究,无组件归因:恢复、重采集、agent 推理是联合作用被评测的,CEC 和 ADC 各自贡献多少没有拆(作者承诺后续补消融);
  3. (补)递归深度受预算封顶:轮数与配额预设,RSI 在这里更像「聪明的两轮数据配比」,而非开放式的持续自我超越;
  4. (补)重建误差决定上限:SAM3D 重建的几何/物理属性若失真,ADC 的归因与 cuRobo 的验证都会在错误的地基上打转(论文靠 AACR + 逐项校验缓解,但未给重建误差的定量评估)。

🌍 第三形态:世界模型当「想象沙盒」——RSI 的另一半拼图

两篇论文之外,2026 年的具身 RSI 还长出了第三根枝,值得单独交代,因为它和你的世界模型工作线直接相关。

如果按「递归里跑的是什么」给 RSI 分类,会得到三种形态:

RSI 的三种形态:工具链自改进 / 数据自循环 / 想象递归

  1. 工具链自改进(改代码/改技能库):Voyager 一脉,Zetta 是它的具身形态——递归的对象是 critic、恢复剧本、工具集这些可执行代码资产,策略本身不动。
  2. 数据自循环(改数据分布):DAgger → SOAR → RECAP → EmbodiRSI——递归的对象是「下一步采什么」,每轮 rollout 的失败反过来当采集器的输入。
  3. 想象递归(改环境本身):RISE 用组合式世界模型做策略改进——在学到的世界模型里做想象 rollout、做优势估计,再回真实机器人验证(论文报告在动态抓放、背包收纳、关箱等任务上较基线提升 35/45/35 个百分点量级);Dream-RSI(arXiv 2609.14858)走得更远,主张「可重放的模拟器就是可递归探索的世界」,把 RSI 从「改进策略」上升到「递归探索算法、内核与数学工具本身」。

三者其实可以叠着用:世界模型产想象数据(形态 3)→ ADC 式采集器挑数据(形态 2)→ 失败蒸馏成 critic 代码(形态 1)。GigaWorld-0 那类「世界模型当数据引擎」的工作解决「数据从哪来」,Zetta 这类 harness 解决「执行怎么稳」,Dream-RSI 这类工作追问「递归的边界在哪」——三张拼图合起来,才接近《The Last AI Built by Humans》里 L4~L5 的图景。


⚖️ 两篇对照:同一思想,两种物理形态

维度ZettaEmbodiRSI
核心信念该进化的是策略外面的执行系统该进化的是喂给策略的数据分布
冻结什么π_VLA 与 A_orch 全程冻结每轮都更新 π(从上一轮继续训)
优化对象舱体 H = {critic, recovery, tools}(代码资产)数据集 D 与参数 θ(+ 采集分布 p)
反馈进化的通路失败 → 聚类诊断 → 修复补丁 → 打包回流失败 → 归因网格 → 定向采数 + 纠错轨迹 → 训练回流
回合内干预critic 提案 + orchestrator 裁决触发恢复监视器 y_t 决策 + CEC 状态条件恢复
质量闸门历史回归 100% + 留出 ΔSR>0 + 验收集一次性归因统计阈值 + 逐条示教物理验证 + 终评关闭 agent
智能体模型角色只在离线写代码(在线零 LLM 调用)只在数据管线里当监督者(评测时零接管)
评估硬件8×RTX 4090(进化)+ 8×A100(Z-Infra)Isaac Sim + GPT-5.5 agent + 真机 ALOHA
验证落点纯仿真基准(LIBERO-Pro / RoboCasa)仿真 + 真机(3 场景 14 子任务,10 次/设置)
头条数字Goal 集 34.5→90.8;RoboCasa 73.56→93.56仿真 50.4→83.5;真机 83.1 vs 75.0(1/20 物理数据)
延迟哲学把 LLM 请出执行环,代码站岗把 LLM 放进采集管线,策略裸考
主要短板无真机、任务知识人工预置单场景适配、无组件消融

最有意思的一行是**「回合内干预」**:两篇其实都做了「失败状态下的回合内恢复」(Zetta 的 Recovery、EmbodiRSI 的 CEC),但产出物截然不同——Zetta 把恢复写成可复用的代码技能,EmbodiRSI 把恢复轨迹直接当训练数据。一个存「经验的规则形态」,一个存「经验的数据形态」。


💡 深度评析:三个最妙的设计,三个要留心的边界

三个最妙的设计

  1. 「大模型出环,代码进环」的分工。两篇从两侧逼近同一个答案:物理执行环里容不下大模型的延迟(Zetta 干脆只在离线调 LLM;EmbodiRSI 的测试时直接禁止 agent 接管),于是大模型的智慧被蒸馏成两种可慢速消费的产物——Zetta 是代码(critic/剧本),EmbodiRSI 是数据(矫正轨迹/归因)。这是「快慢系统」在具身上的工程落地:快环跑小模型,慢环养大模型。
  2. 两套防自欺的验收制度。Zetta 的「历史回归 100% + 留出集一次性使用、污染即降级」和 EmbodiRSI 的「测试关闭所有辅助、每条示教先过 cuRobo 物理验证」,都是针对「评测被迭代污染」这一顽疾的制度性防御。方法论论文最该学的往往不是模型结构,是这些看似琐碎的protocol。
  3. 失败的「归因网格」与「最早偏离点」。EmbodiRSI 把最终失败归因到具体复位格子再收紧采样(r̂ = U/N),Zetta 用 t_EOD + 首个缺失里程碑聚类——两者都在做同一件事:把「失败」从一个标量变成一个有坐标的对象。只有失败带坐标,改进才有方向;这也是「数据/代码跟着弱点走」能够成立的数学前提。

三个要留心的边界

  1. 验证鸿沟的分布不均:Zetta 全仿真、零真机;EmbodiRSI 有真机但只有 1~3 个桌面场景、14 个子任务。「闭环自进化」在模拟器里的成立条件(状态可观测、可完美重放)在真机上会被传感器噪声和不可重置性逐条打破——谁先把这套闭环搬到真机长时段运行,谁就拿下下一个身位。
  2. 成功的口径与成本:Zetta 的 90.8% 只算 Goal 扰动集(全集 71.13%),且每个百分点背后是「50 开发种子 × 多轮 rollout × 每轮 LLM 离线诊断」的账单;EmbodiRSI 的 83.1% 依赖 GPT-5.5 管线 + 每场景独立策略 + 预算封顶。RSI 现在是「用计算和 token 换数据效率」的生意,账要算总成本。
  3. 谁定义成功,谁就拥有进化的上限:Zetta 的里程碑与成功判据写死在任务知识 K 里,EmbodiRSI 的目标布局由 agent 对照目标图打分——系统优化的是「逼近人给的成功定义」。把「什么算成功」也交给系统自己发现(即 L4/L5 的评估自主性),目前只有 Dream-RSI 那条想象递归线在试探,成熟度远低于这两篇。

和你读过的工作拼起来

  • GigaWorld-0 / Cosmos-3(世界模型当数据引擎)↔ EmbodiRSI(数据引擎自己会看菜下饭):前者解决产能,后者解决配料方向;把 GigaWorld 的合成管线接上 ADC 式弱点归因,就是「世界模型版的 EmbodiRSI」。
  • RDT / Flow Matching 动作专家(策略本体)↔ Zetta(策略的舱外挂具):策略再强也有执行期故障分布,frozen 策略 + 会进化的舱是与「继续堆参数」正交的一条路。
  • Flow-GRPO / 后训练 RL(改权重的另一派):Zetta 用「不动权重涨 20~40 点」证明了执行期治理是被低估的自由度——两条路不互斥,先加舱再谈微调是更省钱的顺序。

🗺️ 相关工作地图:按「你改的是哪一层」检索

你关心的层代表工作一句话定位
改提示/记忆(数字域 RSI)Reflexion、Self-Refine、Voyager、OPRO(2023)语言反思、技能库、提示搜索
改数据分布DAgger(2011)、RoboCat(2023)、SOAR(2024)、RECAP(2025)自己跑出来的数据回灌训练
验证/过滤自主数据VERITAS(2026)、RoboClaw(2026)视觉验证挑好样本;采集-学习-执行一体
改执行系统/舱体Zetta、HarnessVLA/RPent、ASPIRE、EmbodiSkill、RoboTTTcritic/技能/恢复剧本/测试时适应
改数据 + 改执行EmbodiRSI、ENPIRE、Learning-While-Deploying部署即闭环:执行、验证、选数、更新
世界模型内递归RISE、Dream-RSI(2026)想象 rollout + 优势估计,模拟器即世界
Real2Sim2Real 基础设施RialTo、Re3Sim、RoboTwin、GSWorld 等重建/生成仿真 → 训练 → 回真实
rollout 基础设施A3C、IMPALA、SEED RL、RLlib/Ray、RLinfactor-learner 分离等通用思想(Z-Infra 补的是具身特有负载)
RSI 理论标尺I.J. Good(1965)、Gödel Machine、L1~L5 分级(2609.11873)智能爆炸 → 可证明自改 → 自主度分级

检索心法:拿到一篇「自我改进」的具身论文,先问三个问题——递归对象是什么(代码/数据/环境)?失败存在哪(技能库/数据集/归因网格)?验收谁来做(回归测试/隔离留出/关辅助评测)? 三个答案一定,它在上表的坐标就出来了。


🎤 汇报口述稿

30 秒版:

这两篇 2026 年的论文都在做具身系统的递归自我改进,但路线相反。Zetta 冻结 VLA,让外面的执行舱体——代码写的 critic、恢复剧本、工具——按失败证据自动进化,RoboCasa 上 73.56 拉到 93.56,全程没动一个模型参数;EmbodiRSI 反过来,从真机场景重建专属仿真,在里面用「纠错轨迹 + 弱点定向采数」递归训策略,仿真 50.4 涨到 83.5,最后只用每子任务 10 条真人纠错就以 83.1 超过 200 条真机示教的 75。一句话:一个修策略外面的执行系统,一个修策略自己的数据食谱。

2 分钟版(分四段,按需删减):

背景:递归自我改进不是新词,源头是 I.J. Good 1965 年「智能爆炸」的猜想,2023 年靠 Reflexion、Voyager 这些 LLM 工作在数字域落地,机器人这条线从 DAgger、RoboCat 一直排到 2026 年的集中爆发。

Zetta:它诊断的问题是现有 agent harness 是开环的——反思只在整局结束后发生,物理世界不等你。解法是三个时间尺度的循环:动作频率上跑轻量 critic 做当帧干预(orchestrator 裁决才准动手),rollout 批频率上做聚类和六层因果诊断,迭代频率上过「历史回归 100% + 留出 ΔSR>0」双门才把补丁写进技能包。大模型只在离线写代码,在线零 LLM 调用,所以配套的 Z-Infra 能把吞吐从 1.7 拉到 35.1 条每分钟。结果 Goal 集 34.5 到 90.8,而且学到的恢复技能零样本搬到三个新任务还带 16~20 个点。

EmbodiRSI:它的前提是「下一步需要什么数据取决于策略现在的弱点」。做法是 Real2Sim2Real:SAM3/SAM3D 把部署场景重建进 Isaac Sim,经过碰撞矫正和带物理验证的轨迹生成,得到可信沙盒;里面 rollout 监视器输出 continue/recover/complete,协作纠错从失败状态续接出矫正轨迹,自适应采集用归因网格把专家示教定向砸到弱点格子;数据带 RECAP 式优势标签回训,递归两轮。仿真 50.4 到 83.5,等预算下比静态采集高 20.6 个点,真机 83.1 超过 200 条纯真机示教的 75,物理数据只用了二十分之一。

评价:两篇最漂亮的地方是同一个——都把大模型请出执行快环,把它的智慧蒸馏成慢速可消费的产物(代码 or 数据),并且都建了防评测污染的制度。边界也很清楚:Zetta 没碰真机,EmbodiRSI 只做了场景内适配且没有组件消融。再往下走,把世界模型的想象 rollout 接进来(RISE、Dream-RSI 这条线),三种递归形态就能叠成一个完整的自改进栈。


❓ 自测 Q&A

Q1:Zetta 到底冻结了什么,又进化了什么? 冻结基座策略 π_VLA 和编排者 A_orch(连裁决函数都不变);进化的是舱体 H = {运行时 critic、恢复剧本、工具集},以代码包(SKILL.md + tools/ + plans/ + params/)的形式版本化。成功率的提升全部来自执行期知识,不是参数。

Q2:为什么用代码 critic,而不是让大模型每步盯着执行? 三个理由:① 频率——物理失效发生在亚秒级,大模型推理追不上,代码 critic 跑在动作频率;② 成本——RPent 每个决策点调 LLM API,基线单局延迟就 392~513 秒,Zetta 在线零 LLM 调用,延迟降 91%;③ 可验证——代码补丁能做「历史回归 100%」这种硬验收,模型输出只能靠采样碰运气。

Q3:回控契约 Ψ(s) 解决什么问题? 解决「恢复动作何时算完」的交接安全问题。两个合取条件——原失败证据显式清除 + 物理状态稳定(接触力 > γ)——保证策略是在一个干净、平衡的状态上接回控制权,避免恢复刚做完最抖的那一刻就把主导权还回去导致二次失败。

Q4:EmbodiRSI 的 CEC 和 ADC 分别补什么数据缺口? CEC 补**「从不完美状态出发」的续接数据**——标准示教都是从初始状态演到成功,策略真正卡住的中段没有监督;ADC 补**「弱点分布」的数据**——用归因网格找出当前策略总失败的复位格子,把采样分布往那儿压(p_{k+1} = (1-α)p_0 + α·p_hard)。一个治「状态覆盖」,一个治「配置覆盖」。

Q5:两篇分别怎么防止「考试考到原题」? Zetta:开发种子与考核种子严格不相交;留出集只许用一次,一旦为修新失败而动过舱体,被用过的种子降级为开发种子、必须换全新留出集。EmbodiRSI:训练采集的归因、复位收紧只作用于采数,测试复位完全不变;终评关闭 agent 接管、规划器恢复与人工纠正,每任务每设置独立跑 10 次真机试验。

Q6:这和普通的「多轮迭代训练」有什么本质区别? 多轮迭代的数据分布是预设的(固定数据集反复训);RSI 的数据/代码分布由上一轮自己的失败反向决定——DAgger 是最早的例子,EmbodiRSI 加了归因网格与矫正轨迹,Zetta 更进一步把「失败 → 补丁 → 验收」做成带双门的代码优化循环。「反馈决定下一步生成什么」是 RSI 的判别特征,「递归有预算上限」是它与科幻版 RSI 的分界线。

Q7:为什么说 90.8% 和 71.13% 都对? 口径不同。90.8% = Goal-T 与 Goal-S 两个扰动设置的平均(92.5 与 89.0),对应基线 34.5;71.13% = 再算上 LIBERO-10(T/S) 四个设置的总体宏平均,对应基线 32.00。头条取前者,全集是后者——引用时两个都给,才不会误判强度。


📚 资源与延伸

论文本体

  • Zetta:arxiv.org/abs/2608.16590(2026-08-17,CC BY 4.0),项目页 air-embodied-brain.github.io/zetta
  • EmbodiRSI:arxiv.org/abs/2609.38905(2026-09-30,CC BY-NC-SA 4.0)

顺着 Zetta 读:Harness VLA(基线 RPent,arXiv 2607.08448)、SkillOpt 与 EmbodiSkill(代码空间 SGD 式优化的来源)、REFLEXION / Voyager(数字域自我改进)、LIBERO-Pro(arXiv 2510.03827)、RoboCasa(arXiv 2406.02523)、RLinf(大规模 RL 基础设施对照)。

顺着 EmbodiRSI 读:RECAP(优势条件训练的直接来源)、SOAR(2024 自主数据采集)、DAgger(2011,交互式数据闭环的鼻祖)、RialTo / Re3Sim / RoboTwin(Real2Sim2Real 家族)、SAM 3 / SAM 3D(场景重建组件)、cuRobo / GraspGen(轨迹与抓取验证)。

RSI 主线延伸:I. J. Good《Speculations Concerning the First Ultraintelligent Machine》(1965)、Schmidhuber 的 Gödel Machine 系列、RISE 与 Dream-RSI(世界模型递归)、《The Last AI Built by Humans》(L1~L5 分级,arXiv 2609.11873)。

一句话结论:Zetta 教你把失败蒸馏成可验收的代码资产,EmbodiRSI 教你让数据采集跟着自己的弱点走;下一阶段的赢家,多半是把这两条闭环都接进世界模型想象沙盒的那一个。