论文

不确定性信号有帮助吗?具有回滚机制的不确定性感知解码的系统研究

Do Uncertainty Signals Help? A Systematic Study of Uncertainty-Aware Decoding with Rollback Mechanisms

模型推理推理验证与自校正

摘要

预测不确定性是一种广泛采用的量化模型置信度的指标,下游应用涵盖模型解释、数据选择和预测回滚。尽管其已被证明具有实用性,但不确定性量化在增强 大语言模型 (LLM) 代码生成方面的潜力仍然很大程度上未被充分开发,这就提出了一个关键问题:不确定性在多大程度上可以作为改进基于 LLM 的代码生成的有效信号?为了回答这个问题,我们研究了不确定性感知回滚解码,这是一种推理时间策略,它使用不确定性信号来识别不可靠的生成区域并回滚到较早的有效前缀,而无需重新训练模型。我们在统一解码设置下使用七个代码 LLM、五个代码生成基准和八个 词元级 不确定性信号来评估该框架。我们的结果表明,完整的回滚框架在评估的基准和模型设置上比等预算重启有所改进,在功能代码生成基准上,pass@1 的增益高达 0.26,AvgTestPassRate 的增益高达 0.35,Dsec-Python 上的补丁对齐安全率绝对改进高达 6.4%。在评估的信号中,词元熵和负对数似然等信息论度量显示出最有利的总体趋势,经常在标准基准上取得最佳或接近最佳的结果。组件控制的消融进一步表明,反馈引导的回滚提供了主要的改进,而当检查、预算、回滚和分支衰减保持固定时,不确定性定位提供了额外的增益。