论文
判断不等于枚举:LLM编写可接受集合中的静默遗漏
Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
摘要
语言模型正从考生转变为考官:它们编写测试套、答案、评分标准和奖励函数,以定义其他系统的正确性。我们评估了角色的适用能力,并发现它在通常部署时的协议下表现不足,即一蹴而就的贪婪作者,没有在测试时间进行推理。在四个参考构造中,两个完全穷尽真理,一个有硬化的可执行参考(HumanEval+/MBPP+),一个有明确不完整的词性参考(WordNet),模型在判断候选者是否属于其范围方面表现得更好,而它们自己编写测试套时则表现不佳。在不完整证明的算法构造中,模型在24x参数范围内的F1分数上存在 +0.34到+0.29的差距,并且没有闭合;在可执行代码中,模型在F1 0.74-0.90的情况下,作者只接受19-42%的oracle正确解决方案。控制点定位了缺陷:要求模型发射谓词而不是其扩展,模型达到F1约0.99。失败不是缺少知识或无法指定,而是无法实现由规范诱导的区域。错误主要是遗漏,抵制审计:过度包含是一个可以挑战的词元,缺失成员是作者问题本身缺失的证据。模型检测到植入的过度包含6-7倍比植入的遗漏,而43,227个项目的生产部署在10:1的情况下失败于遗漏优先。在RLVR中,一个作者化的关键成本1.9个点的准确度,与精确的oracle相比,18.5个WordNet相对(六对配对种子,p=0.031)。限制作者化的验证器,使用已知正确的探针,将错误拒绝率从58-92%降低到最多5%,但仅保留5-39%的测试套。相反,通过重写每个错误预期值,使其等于参考执行返回的值,四个作者家庭的生产套数的收率提高了3.3-10.6倍。