论文
TopBench:表格问答中隐式预测推理的基准
TopBench: A Benchmark for Implicit Predictive Reasoning in Tabular Question Answering
摘要
大语言模型 (LLM) 具有先进的表格问答功能,可以通过提取信息或简单聚合来回答大多数查询。然而,一类常见的现实世界查询是隐式预测的,需要从历史模式中推断出未观察到的答案,而不仅仅是检索。这些查询带来了两个挑战:识别潜在意图和对大量表进行可靠的预测推理。为了评估 LLM 在此类使用隐式预测任务回答的表格问题中的表现,我们引入了 TopBench,这是一个由跨四个子任务的 779 个样本组成的基准,范围从单点预测到决策、治疗效果分析和复杂过滤,要求模型生成涵盖推理文本和结构化表格的输出。我们在基于文本和代理工作流程下评估不同的模型。实验表明,当前的模型经常难以识别意图,默认只进行查找。更深入的分析表明,准确的意图消歧是引导这些预测行为的先决条件。此外,提高预测精度的上限需要集成更复杂的建模或推理能力。