论文

DARC:面向LLM进化的解耦非对称推理课程

DARC: Decoupled Asymmetric Reasoning Curriculum for LLM Evolution

模型训练合成数据

摘要

与大语言模型的自博弈已成为实现自我改进人工智能的有前景范式。然而,现有自博弈框架常因以下两点而优化不稳定:(i) 提问者的奖励反馈依赖解题者,导致非平稳目标;(ii) 用于监督解题者的自生成伪标签带来自举错误。为缓解这些挑战,我们提出 DARC(Decoupled Asymmetric Reasoning Curriculum),一个稳定自进化过程的两阶段框架。首先,我们训练提问者合成难度校准的问题,其条件为显式难度级别与外部语料。其次,我们用非对称自蒸馏机制训练解题者:由文档增强的教师生成高质量伪标签,监督无法访问文档的学生解题者。实证结果表明,DARC 与模型无关,在九个推理基准与三个骨干模型上平均提升 10.9 分。此外,DARC 持续优于所有基线,并接近完全监督模型的性能,而无需依赖人工标注。代码见 https://github.com/RUCBM/DARC。

DARC:面向LLM进化的解耦非对称推理课程
图2:两阶段 DARC 框架示意图。在第一阶段(上半部分),Questioner 借助难度锚定奖励学习生成匹配指定难度 τ \tau 的问题。在第二阶段(下半部分),Solver 在离线课程上以答案正确性奖励进行训练。