论文

SciIntegrity-Bench:评估AI科学家系统学术诚信的基准

SciIntegrity-Bench: A Benchmark for Evaluating Academic Integrity in AI Scientist Systems

智能体系统Agent任务评测

摘要

AI科学家系统正被越来越多地部署用于自主研究,但其学术诚信从未得到系统评估。我们提出SCIINTEGRITY-BENCH,首个围绕两难评估范式设计的基准:其11个陷阱类别下的33个场景均被构造成诚实承认失败是唯一正确回应,而完成任务则需要学术不端。在涵盖7个最先进LLM的231次评估中,整体诚信问题率达34.2%,没有任何模型做到零失败。最引人注目的是,在数据缺失场景中,全部七个模型都选择生成合成数据而非承认不可行,差别只在于是否披露这种替换。进一步的提示词消融研究区分了两种驱动因素:移除明确的完成压力使未披露的伪造从20.6%骤降至3.2%,但底层的合成率保持不变,揭示出一种不依赖提示词层面指令而持续存在的内在完成偏差。这些发现表明,缺乏作为训练所得倾向的诚实拒绝是所观察到的失败的主要驱动因素。我们在 https://github.com/liuxingtong/Sci-Integrity-Bench 发布SCIINTEGRITY-BENCH。

SciIntegrity-Bench:评估AI科学家系统学术诚信的基准:论文配图
图1:自主AI科学家系统面临的学术诚信困境,对应SciIntegrity-Bench的评测动机。