论文
符号增强弥合神经事实核查器的规范等价盲区
Symbolic Augmentation Closes a Canonical-Equivalence Blind Spot in Neural Fact-Checkers
摘要
大语言模型在总结科学文本时会产生数字与单位的幻觉,这一失败模式可能悄悄反转一个科学论断。我们把此类错误的检测重构为类型化验证:提出一个五类类型化数量错误分类法与1,500项基准,改写自PMC与arXiv来源,由两名独立LLM标注者标注并经仲裁(Krippendorff's alpha=0.882)。在该基准上微调的ModernBERT编码器达到macro-F1=0.899,远超任何现成神经事实核查器;但四个探针暴露出一个尖锐的结构性盲区:对物理等价量的规范等价改写(如95°C与368.15 K),其准确率崩塌至36.5%。我们提出符号增强——一个训练时框架,反向运行符号验证器的各模块以生成保标签的增强训练数据。该增强把规范等价鲁棒性提升到98.2%,同时略微改善分布内准确率(macro-F1从0.899到0.902);增强后的编码器以零推理成本匹敌闭源前沿LLM,并迁移到外部基准(SciFact-Open二分类macro-F1从0.791到0.828)。两个阴性结果锐化了论断:符号特征作为编码器辅助输入毫无增益,符号银标签在教师噪声下呈负向扩展。这些结果共同表明,训练时增强是符号组件与学习组件之间的正确集成点。