论文
Oracle问题下LLM测试生成中反馈驱动演化的审计和分解
Auditing and Decomposing Feedback-Driven Evolution in LLM Test Generation under the Oracle Problem
摘要
执行反馈通常被视为改进 LLM 生成的测试的自我验证信号。然而,当生成的输入在单个接受的程序上执行并且其输出用作 真值 时,无效或未指定的输入可能会产生虚假故障检测和明显的进化增益。我们使用 142 个开发任务、114 个锁定的外部任务和 138 个保留任务,以及两个代码模型、三个种子和错误交叉拟合的真实提交,在反馈驱动的测试生成中审核这种故障模式。对于三个已接受的实现一致的外部输入,生成的输出仅在 27.79% 和 50.12% 的情况下与专家组匹配。单参考预言机将进化所测得的收益夸大了 9.46-14.85 个百分点;经过审计,等预算独立重采样比基于突变的进化好 6.01-18.83 个百分点。我们进一步将真正的三轮反馈循环与密度匹配的安慰剂进行比较。外部真实安慰剂差异为 +0.13 点和 -0.50 点,而保留差异为 +1.99 点和 +0.28 点,并且没有提供细粒度反馈益处的有力证据。两名软件工程博士生进行的盲态语义审核将 94.41% 的专家组未确认的输入分类为无效,但 3.60% 的输入为有效,表明专家组的分歧是信息性的,但不是语义证明。我们提出了一种审计和安慰剂协议,该协议在自我进化测试生成器的评估中将验证者工件、交互脚手架和有效证据反馈的信用贡献分开。