论文

当审核员捏造时:LLM 植入文档污染检测中的批量退化和可信幻觉

When Auditors Fabricate: Batch-Size Degradation and Confident Hallucination in LLM Detection of Planted Document Contamination

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 越来越多地被提议作为文档质量的自动审核员,但它们作为植入错误检测器的可靠性却很少被描述。我们构建了一个包含 150 篇学术论文的污染语料库,涉及供应链管理和医学研究,注入了三种类型的 450 种已知污染物:印刷错误、语义逆转和荒谬的断章取义插入。然后,我们评估了 Google Gemini 3.0 Pro 在三种规模不断增加的提示机制(单文档、小批量和大批量)下恢复 60 个文档中 180 个污染物的答案关键子集的能力。即使在小规模情况下,检测也是不可靠的,而在大规模情况下则完全崩溃:单个文档的恢复率为 50%,小批量的恢复率为 60%,这是该样本无法解决的差异,而大批量的恢复率为 2.8%。大规模的失败模式不是弃权,而是制造。该模型并没有报告不完整的处理过程,而是得出了令人信服的发现,包括自己发明的污染物,以及模仿种植材料风格但未出现在任何文件中的“心灵感应松鼠”和“量子动力烤面包机”等荒谬内容。检测结果也因污染类型而异:在完成的评估中,荒谬插入的恢复率为 75%,而语义逆转和印刷损坏的恢复率仅为 50%。最有可能在野外发生的、看似合理的腐败,也是最容易被忽视的。我们得出的结论是,LLM 文档审核的降级不是优雅的,而是欺骗性的,并概述了此类系统所需的工具:有限的批量大小、直接内容注入以及根据源文本对每个报告的发现进行机械验证。