论文

智能体轨迹作为程序:指纹识别和编程编码智能体行为

Agent trajectories as programs: fingerprinting and programming coding-agent behavior

智能体系统Agent任务评测

摘要

基准分数告诉您代理做对了什么;他们不会告诉你它是如何到达那里的。在这项工作中,我们介绍了在模型、任务和方法各不相同的不同环境中对代理进行程序比较的方法。我们比较了 10 个智能体,发现它们可以通过行为习惯来识别,我们将其定义为指纹:对这些程序签名的探测将一条看不见的轨迹归因于正确的智能体,准确率达到 85.7%,控制了任务之间的泄漏。我们使用新兴词汇归纳技术开发代理问题解决过程的程序表示,该技术旨在最大程度地压缩以避免表面变化,同时具有足够的表现力以揭示模型模式的怪癖。我们将我们的框架应用于软件工程评估数据集 SWE-Bench,以研究智能体轨迹的结构差异性,并发现来自相似发布周期的模型和相互提炼的模型之间的行为最为相似(例如,提炼的学生模型及其教师的 Jensen-Shannon 散度为 0.25,大约是其他模型对之间距离的一半)。随着越来越多的模型评估饱和,我们认为沿着更全面的维度探索模型行为比仅仅成功率更重要。我们引入了 ProcGrep,这是一个库,用于审核和评估代理如何在程序级别以自上而下的方式处理任务。我们相信这项工作有一系列应用程序可以帮助开发人员使用和编程 编码智能体,例如任务感知模型路由、代理监控和更细粒度的成本分析。