论文精读|NoRD:无需推理的高效数据驱动 VLA

NoRD 挑战 VLA 对大规模数据和推理标注的依赖,仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差(Difficulty Bias)失效,引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。

2026年7月24日 · 2 分钟 · 360 字 ·