论文
下一个模型中什么会幸存?针对单一提示对基于 LLM 的技术进行基准测试
What Survives the Next Model? Benchmarking LLM-Based Techniques Against Single-Prompts
摘要
软件工程研究社区热情欢迎将 大语言模型 (LLM) 集成到复杂技术中以解决各种任务。然而,这种投资的战略性程度仍不清楚,因为连续几代前沿模型的本机功能可能会迅速使现有技术过时。为了评估这项研究投资,我们分析了 ICSE 2026 中的 35 篇基于 LLM 的技术论文。我们评估了他们的复杂工具是否可以通过最简单的替代方案来超越:在新一代模型上执行单个自动生成的提示,无需任何迭代细化。我们发现,对于 37% 到 63% 的论文,具有单一提示的新模型本身就优于一年前提出的精心设计的工具。我们发现,诸如代码生成或修复之类的建设性技术更适合用单一提示来替代。我们还确定了一组幸存的论文,这些论文依赖于为模型提供更多见解的策略,其中较新的 LLM 将放大所提出的技术。我们的研究结果提出了关于旨在解决临时模型缺陷的技术的成本效益主张的问题,以及是否需要关注与未来模型协同扩展的持久挑战。我们的源代码和结果已在 https://github.com/less-lab-uva/What-Survives-the-Next-Model 上公开发布。