论文

Agent心理测量学:智能体编码基准中的任务级性能预测

Agent psychometrics: Task-level performance prediction in agentic coding benchmarks

模型评测智能体系统Agent Harness评测方法与指标

摘要

随着基于LLM的编码从静态单步代码生成转向与工具和环境的多步智能体交互,理解哪些任务会挑战智能体以及原因变得愈发困难。当前实践加剧了这一难题:智能体性能通常以基准上的聚合通过率衡量,而单一数字指标掩盖了基准内任务的多样性。我们提出一个面向智能体编码场景、用于预测单个任务成败的框架。我们的方法用从任务中提取的丰富特征(包括问题陈述、仓库上下文、解答与测试用例)增强项目反应理论(IRT),并引入一种把智能体能力分解为LLM能力与脚手架(scaffold)能力组件的新参数化。这一参数化使我们能聚合来自异构排行榜的评估数据,并准确预测未见基准以及未见LLM-脚手架组合的任务级性能。我们的方法对基准设计者具有实用价值:无需运行计算昂贵的智能体评估,就能更好地校准新任务的难度。

Agent心理测量学:智能体编码基准中的任务级性能预测:论文配图
图 1:预测成功概率的代理和任务特征。我们说明了我们从中得出代理能力得分和任务难度得分估计的特征源。然后,使用估计的代理能力和任务难度,我们应用 IRT(Baker,2001)的逻辑模型来预测代理成功完成任务的概率。