论文
通过渐进式、自适应和交互式反馈对代码改进进行基准测试
Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback
摘要
大语言模型 (LLM) 通常使用二进制功能正确性对代码生成和程序修复进行评估:生成的程序或补丁要么通过测试套件,要么失败。该协议简单但粗糙,因为它忽略了部分进度、反馈使用、回归以及模型通常改进代码的细化轨迹。我们引入了 PAIR-Bench,这是一种用于评估代码改进的渐进式自适应基准:通过反馈引导的细化将不正确或不完整的程序转换为更正确的程序。 PAIR-Bench 使用渐进式提示,这是一种具有两个控件的结构化反馈协议。故障区域控制通过将隐藏的故障测试分组为故障场景来确定反馈目标,而提示深度控制则确定显示多少与修复相关的信息,从粗略症状到实施级指导。这种设计使 PAIR-Bench 能够衡量模型是否修复目标故障、概括超出提示、保留已经正确的行为以及它需要多少帮助。通过评估修复轨迹渐进指标而不仅仅是最终通过/失败结果,PAIR-Bench 提供了对 LLM 代码改进能力的更细粒度的评估。