论文
超越结果:双视图关系学习实现高效代理基准测试
Beyond Outcomes: Dual-View Relational Learning for Efficient Agent Benchmarking
摘要
与传统的 LLM 基准相比,代理基准的评估成本要高得多。因此,基准压缩是一种自然的解决方案,但现有方法主要对任务模型最终分数分布中的冗余进行建模,这在代理评估中很重要。为了解决这一限制,我们分析了大规模轨迹并确定了与最终代理性能系统相关的六个互补过程信号。为了从完整的角度理清代理性能冗余,我们提出了 DualViewEval,这是一种代理基准压缩方法,它联合利用结果和过程关系来学习精确大小的迷你集并预测完整基准分数。在五个代理基准测试和五个代表性基线中,DualViewEval 在所有数据集中实现了最佳结果。仅用 20 个任务,它就在 APEX-Agents 和 BFCL 上实现了 $24\times$--$40\times$ 压缩,与最强的竞争对手相比,平均绝对误差 (MAE) 降低了 $14.5\%$--$28.2\%$,同时在 SWE-bench Verified 上相对于 EssenceBench,Kendall 的 $τ$ 提高了高达 $7.2\%$。所选的迷你集进一步揭示了不同智能体之间的能力差异,为高效的智能体模型开发提供紧凑的诊断反馈。