论文

SkillTV-Bench:评估评审模型对技能增强Agentic执行的判断能力

SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

智能体系统Agent任务评测Agent Skills长程任务评测

摘要

智能体代理通过工具使用和环境交互执行长期任务,评估从最终响应评分转向验证完整的执行。对于技能增强的代理,额外需要在任务时间内编码的程序知识,因为这种知识指示需要检查的证据以及哪些失败是任务关键性的。然而,现有的判例基准往往暴露最终响应或静态轨迹,并且很少结合直接可检查的证据和环境。因此,我们引入了SkillTV-Bench,这是一个包含来自50个任务的1681个真实代理轨迹的基准测试集,旨在评估LLM作为法官和代理作为法官的方法中的技能感知轨迹验证。此外,我们还提出了SkillTV-Evolve,这是一种外部化验证知识为可重用的JudgeSkill,指导代理法官进行有针对性的检查并基于证据作出结论。在独立开发池上,自动化的进化循环进一步使用错误判例来细化JudgeSkill。在SkillTV-Bench上,经过细化技能后,该代理法官的准确率提高了14.8个百分点。在离线抽样选择轨迹成功率方面,它从单个抽样后的22.9%提高到十次抽样后的45.5%。代码和数据可在https://github.com/HanZhi306/SkillTV-Bench处获取。

SkillTV-Bench:评估评审模型对技能增强Agentic执行的判断能力:论文配图
图 1:SkillTV-Bench 和 SkillTV-Evolve 概述。 SkillTV-Bench 将领域覆盖范围、代理交互和技能意识扩展到现有基准之外,而 SkillTV-Evolve 通过迭代 JudgeSkill 演进改进了推出选择和轨迹验证。