论文
SFAD:推测事实感知解码
SFAD: Speculative Factuality-Aware Decoding
摘要
作为大语言模型最关键的挑战之一,上下文忠实性直接决定了其在知识密集型应用中的可靠性。这项任务特别具有挑战性,因为它需要平衡事实一致性和生成效率。对比解码方法需要双前向传递(有上下文和没有上下文)来比较模型输出,使推理计算开销加倍,而 后训练 对齐需要大量的强化学习和大量的计算开销。为了应对这一挑战,我们提出了 SFAD,这是一个 推测解码 框架,可以增强上下文 忠实性 而不会导致推理退化。我们首先构建 ConFide,一个具有细粒度原子扰动的偏好数据集,通过直接偏好优化来训练上下文忠实的草稿模型。在推理过程中,认知摩擦通过量化由专业确定性加权的分布张力来检测潜在的幻觉。当摩擦力超过阈值时,非对称 logits 转向通过基于残差的 logits 注入来细化目标分布;否则,就会进行标准投机。大量实验表明,SFAD 显着改进了 忠实性,同时实现了 $2.48\times$ 加速,为高效的 LLM 提供了实用的解决方案。