论文
PartHackBench:面向部分得分工具智能体评测的认证等进展压力测试
PartHackBench: Certified Equal-Progress Stress Tests for Partial-Credit Tool-Agent Evaluation
摘要
长时程工具智能体常常在没有到达终点成功的情况下取得有用进展,这促使了部分得分评测。然而评测器可能奖励临时的、后来被逆转的、或不可归因于被评测智能体的里程碑。把一条诚实轨迹与一条得分更高的对抗轨迹比较并无结论——如果后者确实取得了更多真实进展。我们提出PartHackBench,一种消除这一混杂的受控方法。私有认证器只在两条轨迹在当前状态谓词满足和标准化智能体归因上逐组件匹配时才接纳一对;得分虚增(定义为f(A) - f(H))只在此之后测量。在PB-CSTE的18个密封留出任务中,冻结的历史目标运行为15个任务产生了匹配的对抗者。历史信用产生平均0.252的虚增、条件攻击成功率10/15、端到端收益10/18,且未检测到14次严格回退中的任何一次。语义LLM裁判更具抵抗力但仍然易受攻击,尤其在面向评测器的攻击下;而PB-CSTE的当前状态控制——定义为认证组件的精确函数——在构造上产生零虚增。PartHackBench因此提供了一个认证控制,用于测试当所有基准定义的任务相关进展保持固定时,评测器信用是否会改变。
