论文
CREDENCE:减少分解和增强可信度的声明——语义度量和收敛分析
CREDENCE: Claim Reduction for Decomposition & Enhanced Credibility -- Semantic Metrics and Convergence Analysis
摘要
将复合句子分解为原子的、可验证的主张是可靠的自动事实检查的先决条件。先前的工作依赖于词元重叠(Jaccard)指标,该指标系统地低估了释义声明的分解质量,并且缺乏对修复循环的正式终止分析。我们提出了 Credence,这是一个修改后的索赔分解和评估框架,解决了这两个缺点。我们的贡献是:(1)Semantic-F1:我们使用BGE-大余弦相似保真度度量来解决Jaccard的惩罚并提高下游事实检查的准确性; (2)收敛定理:我们正式描述了修复管道的四个属性,确定基于规则的修复是单调的并且在预言机解析器假设下有限终止;基于 LLM 的自修复已被证明是非单调的,并且需要提前退出防护; (3)跨越社交媒体、百科全书和新闻领域的三个评估基准,用于跨领域泛化测量; (4) 跨四个分解器模型 (3.8B-12B) 和一个封闭 API 模型的多模型基准测试。 SocialClaimSplit、WikiSplitBench 和 ClaimDecompBench 上的实验表明,Semantic-F1 的性能优于 Jaccard-F1 +15-32pp。 SocialClaimSplit 和 WikiSplitBench 上的 EPR 范围为 0.94 到 1.00,而 ClaimDecompBench 包含由于新闻域构造更困难而导致的较低基础 EPR 案例(低至 0.824),并且规则修复相对于基础模型将原子性违规率 (AVR) 降低了 47-100%,而不会降低保真度。