论文
从猜测到占位:不确定性感知代码完成的成本理论框架
From Guessing to Placeholding: A Cost-Theoretic Framework for Uncertainty-Aware Code Completion
摘要
虽然 大语言模型 (LLM) 在代码补全方面表现出了卓越的熟练程度,但它们通常遵循硬补全 (HC) 范例,即使在上下文不足的情况下也能强制生成完全具体的代码。我们对 300 万次现实世界交互的分析暴露了该策略的局限性:尽管与用户后续代码的相似度超过 80%,但 61% 的生成建议要么在接受后被编辑,要么被拒绝,这表明模型经常在特定标记位置做出错误的预测。受这一观察的启发,我们提出了自适应占位符完成(APC),这是一个协作框架,通过在高熵位置战略性地输出显式占位符来扩展 HC,允许用户通过 IDE 导航直接填充。理论上,我们将代码完成制定为不确定性下的成本最小化问题。基于填充占位符比纠正错误产生的成本更低的观察结果,我们证明了临界熵阈值的存在,高于该阈值 APC 的预期成本严格低于 HC。我们通过从过滤后的现实世界编辑日志构建训练数据来实例化该框架,并为强化学习设计基于成本的奖励函数。对 1.5B--14B 参数模型的广泛评估表明,APC 将预期编辑成本从 19% 降低到 50%,同时保持标准 HC 性能。我们的工作为不确定性感知代码完成提供了理论基础和实践训练框架,证明了自适应弃权可以在不牺牲传统完成质量的情况下端到端学习。