论文
ACL-Verbatim:用于研究的无幻觉问答
ACL-Verbatim: hallucination-free question answering for research
摘要
学术研究人员需要高效可靠的方法来从可信来源收集高质量信息,但人工智能辅助研究的现代工具仍然存在 大语言模型 (LLM) 产生事实上不准确或无意义输出的倾向,通常称为幻觉。我们将提取问答系统 VerbatimRAG 应用于 ACL Anthology 中的研究论文,将用户查询直接映射到检索文档中的逐字文本范围。我们贡献了一个新颖的 真值 数据集,用于将用户查询映射到研究论文中的相关文本范围,并用它来训练和评估各种提取模型。人工注释由 NLP 研究人员执行,基于使用基于 ScIRGen 方法的自定义管道生成的合成用户查询,并与 VerbatimRAG 检索的研究论文块配对。在此基准测试中,经过我们管道的白银监督训练的 1.5 亿参数 ModernBERT 词元分类器实现了最佳字级 F1 (53.6),领先于评估最强的 LLM 提取器 (48.7)。