论文
ALIVE:通过对抗学习与启发性语言评估唤醒LLM推理
ALIVE: Awakening LLM Reasoning via Adversarial Learning and Instructive Verbal Evaluation
摘要
在大语言模型(LLM)中追求专家级推理一直受到持续的奖励瓶颈(reward bottleneck)阻碍:传统强化学习(RL)依赖标量奖励,而标量奖励扩展成本高、跨领域脆弱,且对解答背后的逻辑视而不见。这种对外部贫乏信号的依赖阻碍模型形成对推理原则深入而自足的理解。我们提出ALIVE(Adversarial Learning with Instructive Verbal Evaluation),一个免人手的对齐框架,它超越标量奖励优化,转向内在推理习得。ALIVE以认知协同(Cognitive Synergy)原则为根基,在单个策略模型内统一出题、解题与评判,以内化正确性的逻辑。通过将对抗学习与启发性语言反馈耦合,ALIVE使模型能直接从原始语料内化评估标准,将外部批评有效转化为内生的推理能力。在数学推理、代码生成和一般逻辑推理基准上的实证评估表明,ALIVE持续缓解奖励信号的局限。在相同数据和算力下,它实现了准确率提升、显著更好的跨领域泛化和更高的自我纠正率。这些结果表明,这一推理三位一体能促成自我持续的能力增长轨迹,使ALIVE成为无需人在环监督的通用推理对齐的可扩展基础。
