论文
大语言模型 中战略推理的前瞻优化
Foresight Optimization for Strategic Reasoning in Large Language Models
摘要
大语言模型 (LLM) 的推理能力总体上显着提高。然而,由于缺乏明确的前瞻建模,现有的基于推理的 LLM 在多智能体环境中执行有效的决策能力仍然具有挑战性。为此,引入了战略推理,即预测对方行为并预见其未来可能采取的行动的最基本能力,以缓解上述问题。战略推理是多智能体环境中有效决策的基础,但现有的 LLM 推理增强方法并未明确捕捉其预见性。在这项工作中,我们引入了前瞻策略优化(FoPO)来增强 LLM 中的策略推理,它将对手建模原理集成到策略优化中,从而能够明确考虑自身利益和对手影响。具体来说,我们构建了两个精选数据集,即 Cooperative RSA 和 Competitive Taboo,它们配备了精心设计的规则和适度的难度,以促进在自我对弈框架中对 FoPO 进行系统研究。我们的实验表明,FoPO 显着增强了不同大小和来源的 LLM 的策略推理。此外,使用 FoPO 训练的模型对域外战略场景表现出强大的泛化能力,大大优于标准 LLM 推理优化基线。