论文

代理评估中的政策漏洞:当政策模糊性伪装成代理错误时

Policy Loopholes in Agent Evaluation: When Policy Ambiguity Masquerades as Agent Error

智能体系统Agent任务评测

摘要

代理基准评估策略合规性,但假设每个策略确定唯一的正确操作。自然语言政策可以通过沉默、模糊或矛盾来违反这一假设,承认单一黄金轨迹无法捕捉到的多种合理解读。通过审核两个$τ^2$-bench域,我们开发了此类政策漏洞的分类法,并表明受影响的任务会产生不可靠的分数:它们以不同的方式降低不同模型的分数,并使每个模型在重复试验中不太一致。跨域比较表明,可利用性需要策略模糊性和工具许可性:当策略复杂性超过工具可以执行的范围时,代理会不一致地解决差距,并且分数变得不可靠。政策规范质量决定了评估质量的上限。基准开发人员应在收集黄金注释之前审核策略。