论文

通过可验证推理跟踪奖励增强 TableQA

Enhancing TableQA through Verifiable Reasoning Trace Reward

模型推理推理验证与自校正

摘要

与标准的基于文本和图像的代理相比,训练 TableQA 代理的一个主要挑战是,不能从静态输入推断答案,而必须通过表状态的逐步转换来推理,从而引入多步推理复杂性和环境交互。这就引出了一个研究问题:表转换动作的显式反馈能否提高模型推理能力?在这项工作中,我们引入了 RE-Tab,这是一个即插即用的框架,通过将问题表述为部分可观察的马尔可夫决策过程,通过轻量级、免训练的奖励模型在架构上增强了轨迹搜索。我们证明,在状态转换(“最好的行动是什么?”)和模拟推理(“我确定输出吗?”)期间提供明确的可验证奖励对于引导代理在表状态中的导航至关重要。通过在表转换中使用奖励反馈强制执行逐步推理,RE-Tab 在 TableQA 中实现了最先进的性能,推理成本下降了近 25%。此外,RE-Tab 的直接即插即用实现将 QA 准确率提高了 41.77%,测试时推理样本下降了 33.33%,以获得一致的答案。各种大语言模型和最先进基准的一致改进模式进一步证实了 RE-Tab 的普遍性。该存储库位于 https://github.com/ThomasK1018/RE_Tab 。

用确定性表状态奖励增强表格推理
图1:(a) 无奖励的表格智能体(Chain-of-Tables(Wang et al., 2024))、(b) 带世界模型奖励的 VLM 智能体(VAGEN(Wang et al., 2025a))与 (c) 我们提出的 RE-Tab 的对比示意。给定一个分数以 box score 文本形式嵌入的复杂表格:(a) 检索正确但缺乏用于正确推理的显式奖励;(b) 推理正确但在准确检索表格方面有所不足;(c) RE-Tab 迭代地提供可验证奖励作为反馈给智能体,以评估转换正确性,并进行多个思维过程来搜索奖励最高的答案,从而在推理与检索任务上实现持续改进。