论文

用科学数据进行微调会增加幻觉吗? LLM的多领域真实性评估

Does Finetuning with Scientific Data Increase Hallucinations? A Multi-domain Factuality Evaluation of LLMs

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于交流和解释科学概念,但它们产生幻觉的倾向在这种高风险用例中带来了重大风险。先前的科学幻觉评估工作仍然主要局限于生物医学领域,将幻觉视为一项二元任务,并且没有对不断增长的经过科学微调的 LLM 家族进行检验。我们通过 SciFactCheck 来解决这些差距,SciFactCheck 是一个包含五个科学领域 2,500 个提示的基准,并配有针对三种事实幻觉类型的模块化评估框架:不可验证性、过度主张和归因。使用受控最小配对设计,我们通过将每个经过科学微调的模型与其通用基础进行比较来评估 18 LLM。我们的结果表明:1.经过科学微调的模型在所有幻觉类型和科学领域中都表现出事实可靠性下降的情况,2.经过微调的模型内部信心不足,但语言上更加自信。一项人类试点研究进一步表明,当前的事实检查工具与专家对科学内容的判断仅表现出适度的一致性,并且即使在人类注释者中,定义具有科学检查价值的主张仍然存在争议。我们的研究结果从根本上挑战了当前特定领域 微调 的真实性方法,并呼吁开发改进的科学内容验证基础设施。