论文
迈向稳健的数值验证
Towards Robust Numerical Claim Verification
摘要
大语言模型 (LLM) 广泛用于索赔验证,但对于数值推理来说仍然很脆弱:即使值的微小变化也会急剧降低准确性。我们表明,这种脆弱性在前沿大语言模型中仍然存在,但可以通过对数值扰动的例子进行对抗性微调来减轻。使用参数高效的微调,小型 Qwen3 模型 (0.6B$\unicode{x2013}$8B) 在标签翻转扰动方面达到 98.7% 的准确度,优于较大的零样本模型和前沿系统(GPT-5.4 Pro (74.0%) 和 Gemini 2.5 Flash (73.9%))。这些增益泛化到看不见的扰动类型,表明稳健的数值决策边界而不是记忆的编辑。鲁棒性还可以在没有目标域数据的情况下进行传输,从而显着提高西班牙语的跨语言性能。我们使用维生素C 数据集进一步表明,相同的微调方法赋予了对证据侧扰动的鲁棒性。