论文
LC-ERD:经一致性调控的奖励分解挖掘潜在逻辑实现自演化推理
LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition
摘要
大语言模型(LLM)推理的演化受制于高质量过程数据的稀缺。虽然经由内生奖励的自对齐提供了一种方案,但挖掘有效监督面临三重挑战:(1)模仿偏差带来的标签噪声,即奖励优先统计似然而非逻辑真值,制造出掩盖复合错误的“正确性幻觉”;(2)粗粒度监督,稀疏的全局结果(如GRPO中)无法提供细粒度指导,将推理链视为不可分的整体;(3)分布坍缩,信号无法在不放大预训练偏见的情况下泛化。为此,我们提出LC-ERD(Logic-Consistent Endogenous Reward Decomposition),一个将自对齐视为潜在结构挖掘的框架。我们通过聚合模型潜在逻辑专长(LLE)的共识推导出变分逻辑势(Variational Logic Potential)以对推理流形去噪,并引入基于IGM原则的多智能体价值分解协议来量化各步骤的效用。实验表明,LC-ERD提供了稳健的自演化路径,揭示了逻辑一致性与准确率之间的权衡,并识别出标准奖励所遗漏的高价值推理模式。代码见 https://github.com/LC-ERD-repo/LC-ERD。
