论文
DARC:面向LLM进化的解耦非对称推理课程
DARC: Decoupled Asymmetric Reasoning Curriculum for LLM Evolution
摘要
与大语言模型的自博弈已成为实现自我改进人工智能的有前景范式。然而,现有自博弈框架常因以下两点而优化不稳定:(i) 提问者的奖励反馈依赖解题者,导致非平稳目标;(ii) 用于监督解题者的自生成伪标签带来自举错误。为缓解这些挑战,我们提出 DARC(Decoupled Asymmetric Reasoning Curriculum),一个稳定自进化过程的两阶段框架。首先,我们训练提问者合成难度校准的问题,其条件为显式难度级别与外部语料。其次,我们用非对称自蒸馏机制训练解题者:由文档增强的教师生成高质量伪标签,监督无法访问文档的学生解题者。实证结果表明,DARC 与模型无关,在九个推理基准与三个骨干模型上平均提升 10.9 分。此外,DARC 持续优于所有基线,并接近完全监督模型的性能,而无需依赖人工标注。代码见 https://github.com/RUCBM/DARC。
