论文

ReliableTableQA:可靠性注释需要多少监督?

ReliableTableQA:How Much Supervision Does Reliability Annotation Need?

模型训练监督微调与指令调优

摘要

我们引入了 ReliableTableQA,这是一个用于训练 LLM 的框架,用于注释表格 QA 结果的统计可靠性,不是查询是否可回答,而是计算的答案是否具有统计意义。在真实的企业分析中,语法正确的 SQL 查询可能会返回基于过小的样本、具有过宽的置信区间或过于混乱而无法支持操作的值。现有系统在所有此类情况下都能自信地回答,我们将这种失败量化为不可靠的置信回答率 (UCAR)。我们贡献(1)一个十类可靠性分类法(R1-R10),涵盖小样本总量、多重比较通货膨胀和分布尾部不匹配等风险; (2) 程序优先的数据管道,通过公共零售模式的上下文无关语法生成 50,000 个可靠性标记的训练示例,并进行模式分层的 SFT/GRPO 分割; (3) 对监督校准可靠性注释实际需要多少进行对照研究。我们发现一个小的、模式分层的 SFT 集非常足够:200 个示例将可靠性标志 F1 从 0.61 提高到 0.98,解析率从 0.52 提高到 1.00,将 UCAR 驱动到零,并产生一个泛化到看不见的零售领域的模型(保留的 H&M 上的 Rel-F1 0.997)。相对于这个强大的 SFT 基线,GRPO(通常被认为是必不可少的)仅在 SFT 训练不足时才有帮助(100 个示例的 +0.06-0.16 精确标志集匹配,分布内和分布外),并且一旦 SFT 足够,就不会提供可测量的好处,我们通过硬复合标志切片、严格的精确匹配度量和分布外评估确认了一个空结果。我们的研究结果将可靠性注释重新定义为数据效率问题,并准确描述强化 微调 何时有效和何时无效。