论文
当LLM不小心读表时:测量和减少数据引用错误
When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors
摘要
虽然 大语言模型 (LLM) 在表任务上表现良好,但它们仍然会出现数据引用错误 (DRE),即,尽管了解表结构,但错误地引用或省略了表值。除了最终答案的准确性之外,DRE 还直接损害中间推理步骤的正确性和可靠性。然而之前的研究只提供了有限的小规模分析。在这项工作中,我们首次对不同模型和任务的表格数据引用错误进行系统评估。我们的结果表明,DRE 出现在所有测试模型(1.7B 至 20B 参数)中。此外,我们证明,通过基于批评家的过滤和拒绝抽样,将数据引用作为批评家可显着提高答案准确性,最高可达 12.0%。最后,我们训练了一个轻量级的 4B 参数批评模型,该模型在检测分布内和分布外 DRE 方面的平均 F1 分数达到 78.2%,并有效辅助大型模型的推理。