论文

ASMR-Bench:机器学习研究中的破坏审计

ASMR-Bench: Auditing for Sabotage in ML Research

模型评测基准与评测资源

摘要

随着人工智能系统越来越多地用于自主进行研究,失调的系统可能会引入微妙的缺陷,从而产生误导性的结果,同时逃避检测。我们引入 ASMR-Bench(机器学习研究中的破坏审计),这是一个评估审计员检测机器学习研究代码库中破坏行为的能力的基准。 ASMR-Bench 由 9 个 ML 研究代码库组成,其中包含被破坏的变体,这些变体会产生性质不同的实验结果。每次破坏都会修改实现细节,例如超参数、训练数据或评估代码,同时保留论文中描述的高级方法。我们在 ASMR-Bench 上评估了前沿大语言模型和大语言模型辅助的人类审计员,发现两者都难以可靠地检测破坏:最佳性能是 AUROC 为 0.77,top-1 修复率为 42%,由 Gemini 3.1 Pro 实现。我们还以红队成员的身份对大语言模型进行了测试,发现大语言模型产生的破坏比人为产生的破坏要弱,但有时仍能逃避具有相同能力的大语言模型审计员。我们发布 ASMR-Bench 来支持人工智能研究的监控和审计技术研究。

ASMR-Bench:机器学习研究中的破坏审计
图 1:方法。红队修改代码库实现以产生质量不同的结果,而不改变高级方法。蓝队收到诚实版本或被破坏的版本,必须确定哪个版本并提出修复方案。