论文精读|NoRD:无需推理的高效数据驱动 VLA
NoRD 挑战 VLA 对大规模数据和推理标注的依赖,仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差(Difficulty Bias)失效,引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。
NoRD 挑战 VLA 对大规模数据和推理标注的依赖,仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差(Difficulty Bias)失效,引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。