AuditRepairBench:面向智能体修复中评估器通道排名不稳定的配对执行轨迹语料
AuditRepairBench: A Paired-Execution Trace Corpus for Evaluator-Channel Ranking Instability in Agent Repair
摘要
代理修复排行榜在评估器重新配置下重新排序,并且可测量的重新排序份额是通过在内部选择候选修复期间参考评估器导出的信号的方法产生的。我们在公共排行榜上记录了这种故障模式,并发布了 AuditRepairBench,这是一个包含 576,000 个注册单元(执行了 96,000 个)的配对执行跟踪语料库,可在声明的可观察性边界内实现评估器通道阻塞排名不稳定性。模块化筛选架构通过四种可互换的实现、学习影响代理、不使用训练模型的基于规则的通道暴露比、反事实敏感性代理和稀疏人类审计代理来决定通路阻塞,组合成筛选后验,为细胞级翻转函数、集值标签、分层系统得分和集值排行榜提供数据。该资源得到了对 80 例源级通道手术子集的机制锚定验证的支持,这是一种独立发现协议,在该协议下,与管道开发人员分开的两个注释器组发现了对筛选设计视而不见的耦合模式,并且冻结的集成在其 79 个案例中达到了汇总 AUROC 0.83、实现稳健性、不确定性传播(将 95% 覆盖率从 0.81 提高到 0.95)以及通过汇总进行前向传输社区评估者 Spearman \r{ho} = 0.65。筛选引导的致盲补丁在少于 50 行代码的情况下将排名位移减少了 55--74%(平均 62%),而随机通道致盲最多可减少 7%,通用再训练最多可减少 13%。 AuditRepairBench-Lite 是 12,000 个单元子集上的仅规则配置,在 24 个 GPU 小时下保留 Kendall τ = 0.88 的排行榜,并且是 42 GB 的主要发布工件。
