论文

DiagEvo:通过分层错误记忆实现诊断引导的自我演化

DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory

模型训练上下文与知识合成数据记忆Agent记忆

摘要

自我对弈是语言模型自我进化的有效范例,但如果没有指导,求解器的性能可能会在各轮中趋于稳定或下降。无指导的方法通过难度、可学习性或多样性等信号来引导问题的生成。这些信号使问题保持​​挑战性和多样性,但没有具体说明后续几轮应针对哪些未解决的推理弱点。引导方法从外部任务资源(包括人类示例、文档语料库或指定的难度目标)获取方向,因此依赖于自播放循环之外提供的任务信息。我们表明,所需的方向可以从求解器自己的失败历史中得出。我们介绍 DiagEvo,其诊断程序从历史记录中提取重复出现的错误原因,并将其存储在分层错误原因存储器中。记忆将相关原因分组到技能节点下,并根据目标问题的自我一致性将每个原因跟踪为“活跃”或“掌握”。挑战者使用这些状态和重复计数来平衡目标生成和自由探索。仅当最常见的求解器答案具有明显的投票领先优势时,双置信度过滤才会保留中等难度的问题。 DiagEvo 从自我游戏过程中产生的信息中获取课程,无需外部任务资源。使用默认的 4B 诊断程序,DiagEvo 在三个求解器(Qwen3-4B、Qwen3-8B 和 OctoThinker-8B)的所有九个基准测试中的平均准确度优于每个基准。在 Qwen3-8B 上,它在五个数学推理基准测试中的平均准确度达到 72.3%,比 R-Zero 高出 4.5 个百分点。它在所有九个基准测试中的平均准确度为 57.4%,比 DARC 高出 1.1 个百分点。消融表明,分层错误原因记忆和双置信过滤都有助于这些收益。

DiagEvo:通过分层错误记忆实现诊断引导的自我演化:论文配图
图1: 纯粹自由勘探和DiagEvo下的共同革命。(a) 纯粹的免费勘探产生的问题更长,而求援者的业绩则停止改善。DiagEvo 保持问题长度稳定,提高数学平均数。(b) 示例问题显示,非制导自玩如何使各轮的表面复杂性增加。(c) DiagEvo使用等级错误的记忆来引导问题在各回合的生成。