论文

通过帕累托排序策略优化实现帕累托最优工具集成代理

Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

模型训练强化学习

摘要

工具集成语言代理的最新进展显着提高了它们解决复杂推理任务的能力。然而,现有的对齐方法主要侧重于最大化任务准确性,而忽视了工具使用效率等辅助目标,而这对于实际部署至关重要。为了解决这一差距,我们引入了 ParetoPO,这是一种两阶段多目标优化框架,用于在竞争目标下调整使用 大语言模型 (LLM) 的工具。在第一阶段,ParetoPO 利用超容量引导的动态量化来根据全球 Pareto 前沿进展调整奖励权重。在第二阶段,它用基于帕累托排序的优势计算取代了标量化学习信号,通过支配感知贡献分配来促进非支配轨迹。这种设计可以跨多个相互冲突的目标进行细粒度的操作级优化。数学推理和多跳 QA 任务的实验结果表明,与静态和启发式基线相比,ParetoPO 始终能够发现具有卓越的准确性-效率权衡的策略。