论文

当言语不足时:言语推理与 LLM 置信度估计的隐藏特征之间的迭代协同

When Words Fall Short: Iterative Synergy Between Verbalized Reasoning and Hidden Features for LLM Confidence Estimation

模型评测评测方法与指标

摘要

置信度估计对于开发值得信赖的大语言模型 (LLM) 至关重要,大多数方法都遵循基于估计器或基于语言化的范式。虽然最近的研究越来越关注改善口头自我信心报告,但我们对这种方法超越独立信心估计者的普遍观点提出了挑战。我们的实证研究表明,专用的置信度估计器可以大大优于口头表达的置信度,这表明LLM的内部表征包含更丰富的置信度信号。基于这一发现,我们提出了迭代策略估计器训练(IPoET),这是一个可以协同语言推理轨迹和信息表示的互补优势的框架。 IPoET 将策略优化与估计器更新交替进行,将估计器导出的置信反馈集成到策略学习中,并在新策略rollout时刷新估计器。跨不同数据集以及 Qwen 和 Llama 主干网络的实验表明,通过迭代地利用更丰富的隐藏特征并适应不断变化的策略分布,IPoET 在域内始终优于基于估计器和基于语言的基线,并在所有域外指标中实现了优异或可比的结果。更多详情请参考https://github.com/xyk829/ipoet.