论文
TraceDance:从部署轨迹生成定向Agent行为评测
TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces
摘要
Agent可以完成任务,但在执行过程中表现出不良行为。除了固定的基准测试套件之外,开发人员还需要针对部署中遇到的特定行为进行测试。我们引入了 TraceDance,这是一个Agent系统,它根据部署跟踪针对用户指定的不良行为构建有针对性的基准。为了高效构建,锚定和确认将可编程检索与 Flash 大语言模型 (LLM) 的候选级确认相结合,同时锚定综合循环生成和修改自定义行为的规范。这些基准使用决策点延续来评估LLM在记录的决策点的下一个回合,并使用特定于行为的评分标准,而无需参考答案或环境重放。编码和通用工具使用实验利用了 252,557 个会话,并使用 4,125 个实例生成了 107 个基准测试,满足了 95.3% 的构建目标请求。两位人类注释者都在 84% 的采样实例中确认了所请求的行为,并且自动评分者与人类通过/失败判断的一致性与注释者之间的一致性相当。九个前沿LLM的平均通过率仅为 26.7%,这表明他们仍然难以在评估的决策点做出适当的反应。对特定行为基准的分析进一步揭示了当前LLM作为Agent行为方式的弱点。通过将部署问题转化为有针对性的基准,TraceDance 可以作为递归自我改进 (RSI) 循环的关键组件。