论文

ArrivalBench时序正确性重放

ArrivalBench: Agent-Generated Data Pipelines Are Correct Once and Wrong Under Time

智能体系统Agent任务评测

摘要

智能体生成数据工作的基准按固定快照运行一次来给管道打分。ArrivalBench改为在对抗但可重放的到达调度(迟到、重复、乱序与重试记录)下重执行智能体留下的管道,并要求其最终状态等于对完整日志的批量重算。由于预言机重算而非分类,错误的表与崩溃是两种不同判定:崩溃对团队已有的监控可见,错误的表则不可见。在我们构建的40个任务上,单次执行评分的复现实现为十一个模型产出的管道认证86-100%;重放同样产物则发现7.0-79.2%已认证管道静默出错。差距并非修复循环所致:同一模型与任务内,针对快照测试修复过的管道与首次即通过者的重放失败率相当。所有模型中幂等性危害都比排序危害更常失败。区分错误答案与崩溃也改变了干预的解读:一条危害警告把某模型的静默失败从48.2%降到10.5%,同时把崩溃率从9.0%升到37.0%,全失败率仅从51.0%移到44.0%。全部十一臂独立重跑,变化至多5.9点。