论文

CIGPO:多轮取证 LLM 代理的上下文信息增益策略优化

CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents

模型训练强化学习

摘要

使用仅结果强化学习来训练多回合证据阅读代理是不稳定的,因为中间回合几乎没有直接信用。在使用 Qwen2.5-3B-Instruct 的 HotpotQA 实验中,GRPO 最初有所改善(标准 F1 0.430),但随后崩溃至 100% 格式违规输出。训练日志诊断揭示了零优势锁定机制:所有采样轨迹都受到最小格式惩罚(-2.0),组相对优势消失,策略梯度损失变为零——优化死锁。我们提出了一种方差注入策略:通过将每轮奖励分配给中间的证据阅读轮次,我们可以防止群体奖励分布崩溃为单一值——保留 GRPO 群体相对优势所需的变化。上下文信息增益策略优化 (CIGPO) 使用 真值 答案的冻结参考模型对数似然的边际增加作为每轮信号来实现此策略。通过 IG 和 F1 奖励的单独标准化以及 IG 权重课程,CIGPO 在 3B 等级的 HotpotQA 上达到了 0.518 的标准 F1(从 0.252 基础;+105%),而最佳 GRPO 检查点为 0.430,最终 GRPO 检查点为 0.000。 CIGPO 在整个训练过程中保持有意义的奖励差异并避免零优势锁定。这些结果将奖励方差崩溃确定为仅结果 GRPO 的具体失败模式,并表明回合级 IG 奖励可以在 HotpotQA 设置中防止这种情况发生。