论文

使用确定性真值评估LLM长文本生成中的不确定性

Evaluating LLM Uncertainty in Long-Form Generation Using Deterministic Ground Truth

模型评测基准与评测资源

摘要

随着LLM生成日益增长的输出——有效的不确定性估计必须在细粒度层级识别错误——而非丢弃整个响应。虽然此类方法存在——但在任意分辨率(从token到整个生成)上评估不确定性极具挑战且对标签缺陷高度敏感——使零噪声基准必不可少;但长文本生成基准倾向于依赖可错的标签而非确定性真值。我们引入单答案原子长文本目标(SALT)——六个经程序生成、具有单一确定性长文本真值的任务基准——无需外部裁判即可实现正确性、校准与排序的单元级评估。借助SALT——我们对50多个LLM的分析揭示关键洞见:我们识别哪些置信函数在各不确定性方面占优——并表明置信排序在原子分辨率上大面积失效——即使在更粗的行级单元上出现更清晰的可分性。SALT进一步支持贯穿生成的受控原子级干预——揭示未来错误的两个可分离驱动因素:来自损坏前缀的传播——由全局上下文正确性主导——以及随答案-上下文长度增长的有界退化。最后——我们表明推理——无论是经思维链提示还是经训练内化——引入权衡:提升准确率同时降低置信排序。这些发现直接影响需要可靠错误识别与缓解的风险关键应用。

使用确定性真值评估LLM长文本生成中的不确定性:论文配图
图 1:使用 SALT 进行粒度不确定性评估。将长格式生成分解为高分辨率单元可隔离局部误差,揭示被粗略的生成级评估所掩盖的精确校准 (ECE) 和排名 (AUROC) 信号。