论文
了解基于LLM的不完美表格问答中的错误
Understanding Errors in LLM-Based Question Answering over Imperfect Tables
摘要
我们通过对三个大语言模型 (LLM) 人工审查的 RADAR-T 示例进行对照研究,研究了在不完美的表格上进行问答时的错误发现和处理。回答有关这些表的问题需要处理可能影响答案的错误。我们改变行顺序并比较原始表、错误标记表和修复表,以测试发现是否取决于错误出现的位置,以及提供错误的位置是否足以准确回答问题。首先,即使表内容和黄金答案保持不变,对行重新排序也会改变错误发现。后置布局的完整发现率高于前置布局,并且在测试的平均位置上进行平均后,紧凑布局的完整发现率高于宽间距布局。其次,仅提供经过验证的错误位置不足以进行准确的 QA,从而在错误标记表和已修复表之间留下很大的准确度差距。与三个系统中的错误标记表相比,提供已应用人工审核修复的表可将代码辅助 QA 准确性提高 39.0-59.1 个百分点。 GBDI 是一个简单的工作流程,通过将经过整理的表视图中的错误发现与验证和处理报告的错误的明确指导相结合,将这些发现付诸实践。在 RADAR-T 上,GBDI 将五个系统中观察到的 QA 准确性比代码智能体基线提高了 3.8-18.5 个百分点。这些结果凸显了在针对不完美表格的问答中可靠的错误发现和有效的错误处理的重要性。我们的匿名存储库位于 https://anonymous.4open.science/r/GBDI-ICLR-2027-85BD/