论文
LocusRL:诊断竞技游戏中的LLM奖励和策略干预
LocusRL: Diagnosing LLM Reward and Policy Interventions in Competitive Games
摘要
大语言模型可以通过奖励设计和行动选择来干预强化学习,但总体表现并不能完整地说明这些干预措施的实际作用。相似的回报可能隐藏不同的学习机制,而看似合理的奖励可能会引发不良行为。我们引入了 LocusRL,这是一个诊断框架,它将受控奖励策略比较与奖励判断、信号传递、优化目标和执行操作的审核连接起来。该框架将性能差异追溯到可测试的解释,并通过可执行规则和反事实重放检查有针对性的纠正。在涵盖 10 个 Connect Four 训练种子的两个评估批次中,我们发现了干预效果中与种子相关的逆转,并展示了跟踪实际更新如何改变其解释:历史 Qwen 训练通过奖励加权的教师模型行动可能性进行操作。一个单独的匹配三种子奖励方向实验区分了学习信号的敏感性与其有用性。在终端奖励保持固定的情况下,符号反转密集预言机的总胜率为 2.8%,而仅终端训练的总胜率为 57.2%,正密集预言机的总胜率为 46.7%。因此,奖励可以强烈影响学习,但不会提高表现。在决策层面,反事实重播验证了对诊断的行动错误的成功纠正。 Leduc 中的补充实验和 Goofspiel 中的奖励验证研究将分析扩展到不完美信息设置,揭示了参考标签定义和验证数据暴露如何影响干预评估。总之,这些发现说明了为什么评估LLM干预措施需要追踪其输出如何变成学习信号和行动。 LocusRL 将汇总结果转化为可操作的诊断和可验证的纠正。
