论文
AppWorld与WorkArena任务验证器的盲点
Finding Blind Spots in AppWorld and WorkArena Task Verifiers
摘要
基于执行结果的任务验证器决定Agent是否成功。我们采用依据源代码设计的变异测试,审计AppWorld和WorkArena已经发布的验证器;主要审计过程中不修改原验证器。在AppWorld中,重复非幂等写入会产生额外记录,但保持所有被检查字段的值不变。五种符合条件的生成器中,有两种生成器的全部三项任务变体被验证器接受,即15项构造效果中有6项。完成全量检查后,向验证器副本添加记录数量检查,使这6项均被拒绝,同时保留有效对照。在WorkArena中,我们重新执行23个额外字段候选案例,这些案例依据此前验证器给出PASS的结果选取。通过独立Table API回读,确认其中21项存在非默认的持久化值,但全部23项都获得PASS;另外两项所请求的字符串是存储默认值的别名。21项已确认错误效果分布在三种表单模板中。它们证明审计协议下确实存在错误效果,但不能用于估计总体发生率。其他构造未产生经过独立确认的错误接受;其他通过检查器的案例属于效果正确的退化情形。由于所保留证据不同,我们单独报告没有获得PASS的测试族。在固定的意图交换网格中,验证器对2,689次非对角执行均未给出PASS。这是拒绝结果的全量检查:57个WorkArena测试单元保留了会话范围的证据,其他2,632个则缺少分类后的拒绝原因与独立目标事实。每批新增测试都在对其测试单元评分前确定。OpenReview投稿附带补充材料,包含构造语法、原始证据、与内容绑定的阶段沿革及计数复现程序。