论文

Agentic 多轮推理:一种公平方法

Agentic Multi-Turn Reasoning: A Fairness Approach

模型训练偏好优化

摘要

大语言模型 (LLM) 的最新进展使 agentic 系统能够通过多轮规划、工具使用、验证和内存更新来解决复杂的任务。然而,由于两个基本挑战,学习 agentic 系统仍然很困难,即(1)长期信用分配,其中监督仅在最终结果中可用,以及(2)不平衡的数据分布,其中主导数据模式偏向优化并削弱对罕见但信息丰富的推理行为的适应。在本文中,我们提出了公平多级偏好优化(Fair-MPO 或 $\Phi$-MPO),这是一种用于 agentic 学习的新偏好优化框架。我们首先表明,多级偏好优化为长期推理提供了一个有原则且计算效率更高的框架。然后,我们引入一个公平的多级目标来解决 agentic 学习中的不平衡问题。我们提供了全面的理论分析,证明我们的方法可以解决长期推理和数据不平衡问题。我们在 agentic 推理基准上的实验表明,我们的方法实现了最先进的 (SOTA) 性能。