论文
写入时复制评分:特定于应用程序的代理评估
Copy-on-Write Scoring: Application-Specific Agent Evaluations
摘要
在软件系统中可靠地部署基于 LLM 的代理需要评估它们在特定于应用程序的工作流程上的执行情况,并具有足够的粒度来定位它们成功和失败的位置。然而,现有的代理评估机制是有限的:基准测试对于特定于应用程序的工作流程和环境的构造有效性较低,并且副本评估环境昂贵且容易出现偏差。我们提出了 Copy-on-Write (CoW) Scoring,这是一个框架,它使用 PostgreSQL 级别的 Copy-on-Write 机制直接在应用程序环境中评估代理操作,以隔离代理写入。 CoW Scoring 生成会话级和操作级分数,突出显示代理的数据库写入操作在给定应用程序环境中成功和失败的位置,从而能够对代理工具和工具表面进行廉价的评估和迭代。我们在开源项目管理平台 Plane 上演示了该框架,其中分析揭示了工具界面中的具体问题,并且相应的修复对受影响的模型产生了可衡量的改进。 Python 库:https://github.com/trail-ml/agent-cow-python