论文

LLM何时应当更不具体?面向可靠长文本生成的选择性抽象

When Should LLMs Be Less Specific? Selective Abstraction for Reliable Long-Form Text Generation

模型推理推理验证与自校正

摘要

LLM被广泛使用,但仍容易出现事实错误,这会削弱用户信任并限制其在高风险场景中的采用。缓解这一风险的一种方法是为模型配备不确定性估计机制,在置信度低时弃答。然而,这种二元的“全有或全无”方式在长文本场景中限制过度,常常丢弃有价值的信息。我们提出选择性抽象(Selective Abstraction,SA),一个让LLM通过选择性降低不确定内容的细节来以具体性换取可靠性的框架。我们首先通过选择性风险与覆盖率的视角将SA形式化。随后我们提出原子级选择性抽象(Atom-wise Selective Abstraction),一种声明级实例化,它将回复分解为原子声明(各自表达单一事实的简短自足陈述),并用置信度更高、更不具体的抽象替换不确定的原子。为评估该框架,我们开发了一套面向开放式生成的新型端到端流水线,将风险实例化为事实正确性,并用信息论的保留信息度量来测量覆盖率。在FactScore和LongFact-Objects基准上跨六个开源模型的实验中,原子级SA持续优于现有基线,风险-覆盖曲线下面积(AURC)较声明删除最高提升27.73%,表明降低具体性可以在保留大部分原意的同时提升准确性与可靠性。

LLM何时应当更不具体?面向可靠长文本生成的选择性抽象
图2:Selective Abstraction 框架概览。生成的文本被分解为原子(atom),低置信度的原子被置信度更高的抽象所替换。此示例中的置信度阈值为 85%。