论文
GIScholarBench:对 GIS 研究 LLM 过度自信进行基准测试
GIScholarBench: Benchmarking LLM Overconfidence in GIS Research
摘要
大语言模型 (LLM) 越来越多地用于学术研究工作流程,但学术任务需要很高的事实精度,因此暴露了一个关键弱点:过度自信。在这里,过度自信在行为上被定义为即使在基础知识不完整或无法验证的情况下也能产生自信、自信和格式良好的输出的倾向,而不是作为既定信心和准确性之间的校准差距。为了研究这个问题,我们引入了 GIScholarBench,这是一个由 2020 年至 2025 年间在 25 种核心 GIScience 期刊上发表的 10,865 篇论文构建的基准。该基准涵盖三个认知复杂性不断增加的任务:元数据检索、文献链接和研究方向生成。我们在面向用户的真实条件下通过本机 Web 界面评估 Claude Sonnet 4.5、Gemini 3 和 ChatGPT 5.3。结果显示,所有任务都表现出一致的过度自信。在元数据检索中,ChatGPT 5.3 实现了最高的准确度,但当预测错误时,所有模型仍然会生成明确的标题和 DOI。在文献链接中,Claude Sonnet 4.5 恢复了最多的参考文献,但所有模型都显示出顶级检索和较长引文列表之间存在明显差距,这表明参考文献超出了可靠的检索能力。在研究方向生成方面,与真实的未来引用论文相比,人工智能生成的方向显示出较低的主题覆盖率、较高的新颖错过率和较低的语义多样性。这些发现表明,LLM 过度自信是任务不变的,但有不同的形式:检索中的事实过度生成、文献链接中不可靠的引文扩展以及研究构思过程中对输出完整性的过度自信。