论文
推测解码对软件工程任务的实证研究
An Empirical Study of Speculative Decoding on Software Engineering Tasks
摘要
大语言模型 (LLM) 已广泛用于软件工程 (SE) 任务,涵盖从功能级代码生成到复杂的存储库级工作流程。然而,自回归推理的高延迟仍然是一个重大瓶颈,阻碍了它们在交互式环境中的部署。虽然 推测解码 (SD) 提供了一种有前途的无损加速技术,但先前对长上下文存储库级任务和复杂代理交互的研究仍然有限。为了弥补这一差距,我们提出了第一个系统的实证研究来评估 SD 在 SE 任务中的有效性。我们系统地对一系列全面的策略进行基准测试,包括基于模型和无模型的方法,涵盖代表性的生成、编辑和修复场景。我们的实证结果表明,SD 在加速推理方面表现出明显的潜力,特别是对于较小的模型来说,它们比较大的模型实现了更高的加速。我们发现 SD 方法的有效性因不同的任务场景而异。基于模型的方法非常适合代码生成,而无模型方法更适合存储库级修复和编辑场景。此外,我们观察到 SE 任务的重复性提高了无模型方法的性能。与自然语言任务相比,SE 任务具有更高的可预测性,因此可以使用更激进的超参数。我们的研究结果被总结为指南,以帮助提高 SE 场景的推理效率。