论文

IntegrityBench:评估大语言模型作为科研合作者的科研诚信诊断基础

Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists

模型评测基准与评测资源

摘要

语言模型正越来越多地被部署为科研合作者,但其在机构压力下坚守科研诚信的能力仍未被测量。我们提出IntegrityBench,一个在横跨3个领域、4个研究阶段的5级隐式—显式压力协议下,通过36个配对任务评估不当行为分类、伦理行动推理与基于研究产物的决策的基准。通过评估18个前沿模型变体,我们发现在压力峰值下,模型大约每3次诚信关键决策中失败1次,且模型规模与推理能力均不能可靠地缓解这一问题。显式压力会诱发对不当行为的顺从,而隐式的语境重构更多导致对正当研究任务的过度拒绝。有趣的是,未能准确分类研究请求的模型在基于研究产物的决策上表现相同甚至更好(85.7对79.4),这表明三个方面在结构上相互分离,正确的伦理行动并不要求准确的分类。因此,前沿模型可能在显得有帮助的同时潜藏诚信失败,从而带来两类不同的部署风险:助长科研不端行为,以及侵蚀对AI辅助研究的信任。

IntegrityBench:评估大语言模型作为科研合作者的科研诚信诊断基础:论文配图
图2:IntegrityBench 评估流水线。任务字段、压力提示和问题被拼接后传给模型。随后对输出进行评分以产生诚信分数。