论文
并非所有声明都具有相同的风险:事实长格式生成中自适应验证的因素
Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form Generation
摘要
大语言模型 (LLM) 生成流畅的长文本,但经常添加不受支持的事实主张。现有的验证技术通过外部证据的生成来提高事实性。然而,尽管幻觉风险存在差异,但相同的验证政策通常适用于所有索赔。我们提出 \textit{FACTOR} (\textit{面向事实的风险感知验证}),这是一种推理时间模型,可根据声明级别的不确定性调整验证标准。 FACTOR 结合了不确定性估计、自适应语言推理验证和候选重新排名,以将验证工作分配到最需要的地方。我们在 FactScore 基准上评估 \textit{FACTOR} ,表明自适应验证提高了事实性,同时降低了验证成本。我们进一步进行不同的消融研究,以确定这些收益的主要驱动因素。我们的结果表明 \textit{FACTOR} 在提高长格式生成的真实性方面具有有效且与模型无关的性能。