论文

扎根清单 座席技能轨迹的部分得分

Grounded Checklist Partial Credit for Agent Skill Trajectories

智能体系统Agent任务评测

摘要

语言模型代理越来越多地在交互式环境中处理长期任务,但它们的评估通常依赖于任务级成功率,通过将整个执行轨迹减少到任务是否通过官方验证者。这种二元分数隐藏了部分进度,并且对于程序代理技能评估特别有限,因为技能可以改变执行而不改变最终结果。虽然检查表通过对单个任务要求进行评分来提供更细粒度的评估,但昂贵的手动创作和不可靠的自动生成使得可信的评估难以扩展。为了应对这些挑战,我们引入了扎根检查表部分信用(GCPC),这是一种由人类管理和 LLM 实例化的代理轨迹部分信用评估。人类定义一次可重用规则,LLM 从中实例化基于任务指令和官方验证者的特定于任务的清单。为了使判断与证据挂钩,法官仅根据执行日志证据对每个项目进行评分,并在证据缺失时弃权。然后,一个单独的脚本步骤将官方验证者的结果应用于分数。在 4,455 个轨迹、重复数据删除的 SkillsBench 评估群体中,GCPC 比对共享子集进行整体判断更好地区分官方通过和失败结果(AUC 0.689 与 0.619)。对 12 项任务的 96 条轨迹进行的人类评估表明,GCPC 与人类对进展的评估更加一致。 GCPC 应用于 1,946 个匹配/无技能对,揭示了 pass@1 隐藏的影响:在二元结果不变的 879 对中,20.9% 的改进超过 0.10,而 18.7% 则以同样的幅度倒退。 GCPC 管道还转移到 Terminal-Bench 和 SWE-bench,展示了超越技能条件评估的适用性。