论文
IUQ:长形式 大语言模型 生成的疑问不确定性量化
IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation
摘要
尽管 大语言模型 (LLM) 取得了快速进展,但 LLM 生成中的不确定性量化仍然是一个持续的挑战。尽管最近的方法通过限制 LLM 生成简短或受限的答案集而取得了强大的性能,但许多实际应用程序需要长格式和自由格式的文本生成。这种设置中的一个关键困难是 LLM 经常产生语义连贯但实际上不准确的响应,而底层语义是多方面的并且语言结构很复杂。为了应对这一挑战,本文引入了疑问式不确定性量化(IUQ),这是一种利用样本间一致性和样本内 忠实性 来量化长格式 LLM 输出中的不确定性的新颖框架。通过利用询问然后响应范式,我们的方法提供了索赔级别不确定性和模型 忠实性 的可靠测量。不同模型系列和模型大小的实验结果表明,IUQ 比两个广泛使用的长格式生成数据集具有优越的性能。代码可在 https://github.com/louisfanhz/IUQ 获取。