论文
通过可验证推理跟踪奖励增强 TableQA
Enhancing TableQA through Verifiable Reasoning Trace Reward
摘要
与标准的基于文本和图像的代理相比,训练 TableQA 代理的一个主要挑战是,不能从静态输入推断答案,而必须通过表状态的逐步转换来推理,从而引入多步推理复杂性和环境交互。这就引出了一个研究问题:表转换动作的显式反馈能否提高模型推理能力?在这项工作中,我们引入了 RE-Tab,这是一个即插即用的框架,通过将问题表述为部分可观察的马尔可夫决策过程,通过轻量级、免训练的奖励模型在架构上增强了轨迹搜索。我们证明,在状态转换(“最好的行动是什么?”)和模拟推理(“我确定输出吗?”)期间提供明确的可验证奖励对于引导代理在表状态中的导航至关重要。通过在表转换中使用奖励反馈强制执行逐步推理,RE-Tab 在 TableQA 中实现了最先进的性能,推理成本下降了近 25%。此外,RE-Tab 的直接即插即用实现将 QA 准确率提高了 41.77%,测试时推理样本下降了 33.33%,以获得一致的答案。各种大语言模型和最先进基准的一致改进模式进一步证实了 RE-Tab 的普遍性。该存储库位于 https://github.com/ThomasK1018/RE_Tab 。
