论文

何时回答和何时推迟:可靠代码预测的决策框架

When to Answer and When to Defer: A Decision Framework for Reliable Code Predictions

模型推理推理验证与自校正

摘要

代码语言模型越来越多地用于理解和生成任务。尽管取得了成功,但这些模型经常产生过于自信的错误预测和信心不足的正确预测,从而损害了其部署的可靠性。实际部署需要三种能力:准确估计正确的可能性、放弃不确定的预测以及调用外部机制来验证或修复放弃的输出。现有的校准和不确定性估计方法主要是为自然语言任务开发的,不容易转移到代码中。值得注意的是,事后校准技术通常会减少概率错位,但无法通过正确性可能性来提高预测的排名——这是部分覆盖下选择性预测的要求。此外,大多数方法将不确定性视为被动指标而不是可操作的信号。这项工作引入了一个统一的框架,集成了不确定性估计、模型校准和基于工具的代码模型弃权处理。所提出的设计使模型能够分配可靠的正确性概率,在不确定性下弃权,并调用轻量级程序分析程序来处理弃权案例。通过将这些组件组合到一个面向部署的工作流程中,该框架支持跨分类和生成设置的风险感知、覆盖范围控制的代码模型使用。