论文

迷失在代码说话者的流程中:在代码任务中揭晓 大语言模型 的指令调优税

Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks

模型评测模型能力评测

摘要

AI 编码助手通过自动建议符合用户意图的代码,显着提高了开发人员的工作效率,并且其中许多工具现在直接集成到集成开发环境 (IDE) 中。开发人员以两种不同的认知模式与代码交互:流程和命令。虽然开发人员需要在 Flow 模式下直接完成或填充未完成程序中的代码的工具,但他们还需要能够理解以自然语言指令表达的意图并将其转换为 Command 模式下的可执行代码的工具。尽管指令调整的 大语言模型 (LLM) 由于能够推断和实现开发人员的意图而在许多应用场景中占据主导地位,但仍不清楚相同的范例是否同样适用于不同的代码相关任务。因此,有必要了解指令调优如何影响 CodeLLM 作为编码助手的可行性。为了填补这一空白,我们进行了第一项实证研究,揭示了跨编程模式的指令调整所引起的关键权衡,我们将其称为指令调整税。我们的结果表明,指令调整并不是免费的午餐:尽管指令调整的模型更有能力遵循指令并利用结构化指导,但这些收益通常是以较弱的填充性能为代价的。我们通过定性和定量分析进一步扩展我们的研究,包括手动故障分类、捕获生成保真度的行为指标以及整个调优过程中的中间检查点评估。我们的研究将我们的结果总结为七个发现和四个含义,为人工智能驱动的编码工具的开发提供了新的视角,并强调需要仔细平衡指令跟踪能力与有效的代码生成辅助。