论文
TabRank:表重新排名器的思想链 蒸馏
TabRank: Chain-of-Thought Distillation for Table Re-Rankers
摘要
检索相关表格来回答问题的能力是结构化信息检索的关键任务。多阶段检索系统严重依赖重新排序器来细化由高效的第一阶段 检索器 生成的候选列表。因此,神经重排序器和基于 LLM 的重排序方法变得越来越重要,因为与传统的稀疏或密集检索模型相比,它们具有卓越的语义理解和推理能力。最近,配备显式思维链 (CoT) 推理的大型推理模型 (LRM) 在非结构化段落检索中的排名质量方面显示出显着改进。在这项工作中,我们提出了 TabRank,一个用于训练表格检索推理重排序器的框架。我们首先提出了一个包含 6728 个推理轨迹的综合数据集,用于在 Natural Questions Tables 数据集上进行表格重新排序。然后,我们探索在这些推理轨迹上训练紧凑推理模型的两种变体:显式 CoT 蒸馏 和在提示中根据教师的推理轨迹调节学生重新排名。我们在不同域和多表场景的几种分布外泛化设置上对 TabRank 进行压力测试。我们的方法显着提高了各种表检索数据集的性能,与基本模型相比,HybridQA 上的 Acc@10 提高了 30.5%,SQA 提高了 15.2%,TabFact 提高了 52.9%,多表 QA 基准的 TATQA 子集提高了 13.1%。值得注意的是,TabRank 有效地推广到多表推理。我们的代码、数据和模型可在 https://github.com/AdarshSingh7647/TabRanker 获取