论文

匹配很重要:命令行代理的公平质量效率基准

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

智能体系统Agent任务评测

摘要

大语言模型 的快速进步提高了基于命令行界面 (CLI) 的代理的任务解决能力,其 CLI 确定模型如何调用工具、维护交互历史记录以及从故障中恢复。因此,CLI 和 LLM 之间的有效匹配变得至关重要。然而,现有的代理基准主要强调成功率,而忽视了成本和效率等实际目标,以及 LM-CLI 组合的选择,所有这些在实际部署中都至关重要。因此,我们引入了 AgentMeter,这是一种质量效率基准,具有新的指标 AgentMeter 分数 (AMS),该指标共同表征任务质量、预算敏感性和资源密集型零奖励执行,从而能够对已部署的 LM-CLI 对进行更完整的评估。此外,收集的任务描述可能会无意中偏向与其措辞和结构特别兼容的 LM-CLI 对,从而导致评估结果反映特定于描述的优势,而不是一般的任务解决能力。因此,我们提出了 AgentMeter-Opt,这是一个基于轨迹的优化框架,它构建了配对适应、任务保留的描述变体,以跨 LM-CLI 对构建更公平的评估集。大量实验表明,没有任何 CLI 在语言模型中是普遍最优的,并且任务成功、执行成本和 AMS 可以识别不同的竞争配置。 AgentMeter-Opt 的结果进一步表明,任务保留描述更改对 LM-CLI 对的影响不均匀,并且可以改变它们在有效描述条件下的相对顺序。 AgentMeter 和 AgentMeter-Opt 共同为命令行代理的公平且与部署相关的评估提供了实用基础。