论文

INFUSER:影响引导的自我进化提高推理能力

INFUSER: Influence-Guided Self-Evolution Improves Reasoning

模型训练强化学习

摘要

自我进化为更强的推理提供了一条可扩展的途径:预训练的语言模型只需最少的外部监督即可自我改进。然而,现有的方法要么依赖于广泛策划的或教师生成的训练数据,要么当生成器在无人监督的情况下运行时,通过不需要改进求解器的难度启发式来奖励它。我们引入了 INFUSER,一个迭代协同训练框架,具有两个共同进化的角色:一个生成器,从非结构化、自动收集的文档池中起草问题并参考标准参考答案,以及一个通过训练来改进的求解器。求解器根据生成器提供的答案接受标准正确性奖励的训练,而生成器则受到优化器感知影响分数的奖励,该分数衡量每个提出的问题是否会真正改善目标分布上的求解器。由于标准 GRPO 无法很好地满足这种连续的、嘈杂的影响分数,因此我们提出 DuGRPO(GRPO 的双归一化变体)用于生成器训练。总之,这些将文档池变成了自适应课程,有利于当前解决者有用的问题,而不仅仅是困难的问题。在 Qwen3-8B-Base 上,INFUSER 优于强大的自进化基线,在 Olympiad 和 SuperGPQA 基准上相对改进超过 20%,并且 8B INFUSER 协同进化生成器在数学和编码方面优于冻结的 32B 思维生成器。 Ablations 确认每个设计选择都是必要的,并且两个扩展,将 INFUSER 应用于指令微调锚并使用可验证规则的 RLVR 数据对其进行增强,进一步证明了该框架的灵活性和通用性。代码可在 https://github.com/FFishy-git/INFUSER 获取。