论文

校准用于索赔检查价值检测的小语言模型

Calibrating Small Language Models for Claim Check-Worthiness Detection

模型推理推理验证与自校正

摘要

评估声明的检查价值是自动事实检查流程中至关重要的第一步。这项工作的动机是早期启动时的实际部署挑战:在每个传入的索赔上运行 大语言模型 (LLM) 成本和延迟过高,但较小的模型会牺牲准确性。我们提出了 NN-PPI,它是预测驱动推理 (PPI) 的逐点扩展,它作为轻量级事后层在推理时校准模型预测,而无需重新训练底层模型。 NN-PPI 实现的加权 F1 增益范围为 12% 到 33.80%,具体取决于基线模型的大小和性能,使 SLM 与更大的 LLM 相当。除了少数样本 SLM 之外,NN-PPI 还进一步改进了生产部署的微调模型,证明残差校准是监督 微调 的补充。通过从服务成本低一个数量级的模型中恢复 LLM 级准确性,它使得大规模操作的准确的检查价值检测的成本大大降低。我们的代码和数据可以在 https://anonymous.4open.science/r/arr-claim-worthiness-F237 找到。