论文
DS@GT ARC 在 CheckThat! 2026:基于 LLM 的跟踪排名和分组奖励模型,用于多语言数值声明验证
DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification
摘要
数字声明的自动验证是一个具有挑战性的问题,因为它需要语言理解和定量推理。本文介绍了我们的 CLEF 2026 CheckThat 系统!任务 2,重点对 大语言模型 (LLM) 生成的推理轨迹进行排名,并预测英语和阿拉伯语数字主张的最终判决。我们探索两种方法。第一种方法使用 LoRA 微调基于 LLM 的验证器,将每个推理轨迹作为二元分类问题独立评分,并使用 Best-of-N 选择来选择最终判决。我们进一步尝试自适应子声明分解,以在验证之前将复杂的声明分解为更简单的部分。第二种方法使用轻量级 TF-IDF 奖励模型,该模型具有手工制作的数字和时间重叠特征来对轨迹进行评分,并按判决组聚合分数以确定最终预测。对于阿拉伯语,我们将通用多语言模型与 AraBERT 进行比较,AraBERT 是在阿拉伯语文本上预训练的特定语言模型。我们的结果表明,基于 LLM 的方法在大多数指标上都优于轻量级奖励模型,特别是 Recall@5,而基于奖励的方法在冲突类别上显示出更强的性能。子声明分解并没有提高性能,这表明声明拆分会引入噪音而不是帮助推理。对于阿拉伯语,AraBERT 在大多数指标上都优于多语言基线。