论文

ThinknCheck:用紧凑、推理驱动且可解释的模型进行有据断言验证

ThinknCheck: Grounded Claim Verification with Compact, Reasoning-Driven, and Interpretable Models

模型训练监督微调与指令调优

摘要

我们提出ThinknCheck,一个用于有据断言验证的1B参数验证器,它先产出简短的结构化理由,再给出二元判定。我们构建了LLMAggreFact-Think,一个由LLMAggreFact衍生的24.1k规模、推理增强的训练集,并微调4-bit Gemma3模型以遵循该格式。在LLMAggreFact上,ThinknCheck取得78.1的平衡准确率(BAcc),以少7倍的参数超越MiniCheck-7B(77.4);移除推理步骤会使BAcc降至57.5。在SciFact上,ThinknCheck达到64.7 BAcc,比MiniCheck-7B绝对提升+14.7。相比之下,基础Gemma3-1B上的零样本思维链相对于直接作答会损害准确率,而采用简单格式+准确率奖励的偏好优化则不及监督式推理。为探究后者,我们提出GSMClaims及一个领域特化变体ThinknCheck-Science,后者在多个基准上均有提升,包括在GSMClaims上达到61.0%的准确率。总体而言,显式的监督式推理使紧凑验证器在保持资源高效与可解释的同时具备竞争力。