论文

LLM-as-a-Judge 分数是闭环表识别中不可靠的优化信号

LLM-as-a-Judge Scores Are Unreliable Optimization Signals in Closed-Loop Table Recognition

模型评测评测方法与指标

摘要

LLM-as-a-judge 广泛用于在闭环再生中提供反馈和选择信号,但这种用途尚未得到充分验证。我们在表格识别中进行研究,其中确定性 TEDS 评估使用 FinTabNet 和 OmniDocBench 提供了一个受控测试平台。出现了三个发现。首先,两个数据集上的评判信号都很弱:分数经常并列,排名不可重复,并且没有经过测试的评判评分政策,无论是在候选人中进行选择还是在保守的分数差下接受修订,都比两个数据集的第一个输出有所改进。迭代产生了更好的候选者,但法官在一个数据集上最多恢复了部分候选者,而在另一个数据集上则完全没有恢复。其次,即使没有具体的判断反馈,也会发生严重的损失,这支持了无约束再生下的目标保护失败作为一种近似机制。第三,结构保留指令显着降低了严重丢失率,在 FinTabNet 上显着降低,在 OmniDocBench 上定向降低,但没有产生任何改善,并且在探索性 2x2 分析中,当保留判断反馈时,无法稳定观察到这种保护。这些结果并不质疑 LLM 作为评估者的价值,但表明测试的无参考判断信号太弱且不稳定,无法在该设置中驱动候选人选择,并且仅评估式证据不足以建立闭环优化效用。迭代细化至少需要一个验证信号来确定性地检测结构变化,而不是单独判断分数。