论文

跨 26 种大型语言模型的生物医学参考生成仍然不可靠

Biomedical Reference Generation Remains Unreliable across 26 Large Language Models

模型评测模型行为与机制分析

摘要

背景。大型语言模型越来越多地用于帮助编写生物医学文本,但可能会伪造对不存在的工作的引用。大型语言模型这样做的频率尚不清楚。方法。我们提示了 8 个开发人员(2023 年至 2026 年)的 26 个语言模型,为跨 10 个领域的 69 个生物医学段落中的每一个提供缺失的参考。参考文献被分类为可验证(具有解析标识符的真实论文)、部分匹配(没有解析标识符的真实论文)、伪造(没有匹配的索引论文)或拒绝(模型拒绝提供参考文献)。仅当参考文献可验证并且其期刊、年份和列出的作者与被引用论文相匹配时,该参考文献在每个评估的书目领域中才被认为是正确的。结果。捏造的范围从 10.2%(Claude Opus 4.8,减少了 52.1% 的提示)到 98.4%(Ministral 3B,没有产生可验证的参考)。 Claude Opus 4.6 和 Claude Sonnet 4.5 产生的可验证参考文献比例相似(77.6% 和 76.6%),但在作者可评估的可验证参考文献中分别正确命名了 78.7% 和 28.7% 的作者,并且在每个评估领域中正确命名的回复分别为 54.6% 和 19.9%。 GPT-5.5 在各个领域的正确率为 48.1%。在所有模型中,55.4% 的回答是捏造的,14.9% 在每个领域都是正确的。 2026年首次发布的五款测试车型中,对应比例分别为35.3%和31.8%。结论。捏造仍然很常见,并且在超过 54.6% 的答复中,在每个评估的书目领域中没有模型是正确的。识别真实论文的模型仍然可能会错误地表述其元数据,因此使用模型辅助生成的参考文献需要在使用前进行验证。