论文

面向多表问答的合成对比推理

Synthetic Contrastive Reasoning for Multi-Table Q&A

模型训练合成数据

摘要

多表问答需要模型来检索相关证据、链接模式并跨关系表执行组合推理。现有的多表问答资源通常提供问题和最终答案,但缺乏解释答案如何得出的推理监督。为了解决这一差距,我们通过使用异构 LLM 生成经过验证的正迹和合理的负迹,为 MMQA 构建了一个合成对比推理迹数据集。然后,我们使用生成的偏好对通过对比偏好优化(CPO)来微调开放权重大语言模型。在 Qwen3-14B、Mistral-8B 和 Llama-3.1-8B 中,CPO 相对于 Q&A 监督微调实现了 9.7%-16.3% 的绝对平均改进,比 MMQA 提高了高达 21 个百分点。消融表明,异构的正负迹线生成器增强了对比信号,并且自动和人工评估表明生成的对在很大程度上是忠实的、连贯的和有意义的对比。

面向多表问答的合成对比推理:论文配图
图 2:模型多样性的影响。 (上:MMQA,下:MMTU)我们观察到,使用不同的模型(例如 Gemini 2.0)生成推理轨迹始终优于使用相同模型。