论文

LC-ERD:经一致性调控的奖励分解挖掘潜在逻辑实现自演化推理

LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

模型训练奖励建模与过程监督

摘要

大语言模型(LLM)推理的演化受制于高质量过程数据的稀缺。虽然经由内生奖励的自对齐提供了一种方案,但挖掘有效监督面临三重挑战:(1)模仿偏差带来的标签噪声,即奖励优先统计似然而非逻辑真值,制造出掩盖复合错误的“正确性幻觉”;(2)粗粒度监督,稀疏的全局结果(如GRPO中)无法提供细粒度指导,将推理链视为不可分的整体;(3)分布坍缩,信号无法在不放大预训练偏见的情况下泛化。为此,我们提出LC-ERD(Logic-Consistent Endogenous Reward Decomposition),一个将自对齐视为潜在结构挖掘的框架。我们通过聚合模型潜在逻辑专长(LLE)的共识推导出变分逻辑势(Variational Logic Potential)以对推理流形去噪,并引入基于IGM原则的多智能体价值分解协议来量化各步骤的效用。实验表明,LC-ERD提供了稳健的自演化路径,揭示了逻辑一致性与准确率之间的权衡,并识别出标准奖励所遗漏的高价值推理模式。代码见 https://github.com/LC-ERD-repo/LC-ERD。

LC-ERD:经一致性调控的奖励分解挖掘潜在逻辑实现自演化推理
图 2. LC-ERD 框架架构和培训范例。 (a) 通过条件采样引出潜在逻辑专业知识 (LLE),以跨不同基准(数学、医学、法律)构建逻辑一致推理流形 (LCRM)。 (b) LC-ERD 分解模块将内部状态转换为双成分奖励 R = r ~ + γ ⁡ ( Φ h + 1 − Φ h ) R=\tilde{r}+\gamma(\Phi_{h+1}-\Phi_{h}) ,其中 r ~ \tilde{r} 捕获模仿模式,Φ \Phi 表示变分逻辑势。 (c) 训练目标将用于值稳定性的时间差异损失 ℒ T ​ D \mathcal{L}_{TD} 与 logit-alignment 项 𝒟 i ​ n ​ d ​ i ​ v \mathcal{D}_{indiv} 相结合,使模型能够通过最小化其推理路径与潜在逻辑事实之间的差异来进行自我进化。