论文
实时输入适应可靠的代码智能
On-the-Fly Input Adaptation for Reliable Code Intelligence
摘要
代码语言模型 (CLM) 在软件工程的生成和分类任务中发挥着核心作用。然而,即使使用最新数据进行训练,这些模型在现实应用中仍然表现出明显的错误预测。现有的解决方案通过重新训练模型、修改其架构或重新设计提示来解决这个问题。这些方法会产生很高的计算成本,需要在数据标记、模型更新和重新部署方面付出大量努力,并且通常会遇到跨任务泛化性差和跨模型调整不稳定性的问题。这项工作提出了一种基于动态输入适应的替代策略,该策略可以在不改变其参数或需要额外监督的情况下改进模型行为。该方法由两个阶段组成:输入验证(检测可能导致错误预测的输入)和输入适应(使用语法和语义保留操作对其进行转换,以更好地与模型的学习行为保持一致)。这种双重策略减少了不同代码理解任务中的错误预测,从而提高了模型性能,而无需重新训练。作为一种可扩展且资源高效的解决方案,该框架对于可靠性至关重要的软件工程中的高风险应用程序具有重大前景。