论文
CANANTE:通过对比信用归因优化代理系统
CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution
摘要
基于 LLM 的多智能体系统在复杂的现实任务中表现出了强大的性能,例如软件工程、预测建模和检索增强生成。然而,自动化配置仍然是一个结构性挑战,因为分数仅在系统级别可用,而控制代理行为的参数是本地的。我们认为优化这些系统从根本上来说是一个贡献分配问题。因此,我们引入了 CANTANTE,这是一个框架,通过对比同一查询上多个联合配置的采样轨迹,将系统级奖励分解为每个代理的更新信号。我们将其实例化以进行提示优化,将代理提示视为可学习的系统参数。我们在编程 (MBPP)、数学推理 (GSM8K) 和多跳问答 (HotpotQA) 方面对照 GEPA 和 MIPROv2 评估 CANTANTE。在这些基准测试中,CANANTE 在所有评估的优化器中实现了最佳平均排名,并且始终优于未优化的提示。它在 MBPP 上比最强基线提高了 18.9 个百分点,在 GSM8K 上比最强基线提高了 12.5 个百分点,同时推理成本更低。它与 HotpotQA 上的最强基线保持在一个标准差以内。至关重要的是,我们的信用相关性分析证实,归因器会产生有意义的每个代理信号,而不是回响全局系统评分。