论文

任务感知校准:LLM 中可证明的最佳解码

Task-Aware Calibration: Provably Optimal Decoding in LLMs

模型推理解码与生成控制

摘要

LLM 解码通常依赖于模型的预测分布来生成输出。因此,与真实生成分布的不一致会导致实践中的次优决策。虽然自然的解决方案是校准模型的输出分布,但对于 LLM,这在自由形式语言的组合大量级别上是不合适的。我们通过以下见解来解决这个问题:在许多任务中,这些自由形式的输出可以用语义上有意义的潜在结构来解释,例如离散类标签、整数或集合。我们引入任务校准作为范例来校准模型在任务引发的潜在空间中的预测分布。我们应用决策理论结果来表明,对任务校准的潜在分布进行最小贝叶斯风险(MBR)解码是对潜在模型信念的最佳解码策略。根据经验,它可以持续提高不同任务和基线的生成质量。我们还引入了任务校准误差 (TCE),这是一种应用感知校准指标,可量化因校准错误而导致的额外损失。我们的工作表明,任务校准可以在各种任务和应用程序中实现更可靠的模型决策。