论文

先前的审计-修复上下文使LLM校验器阈值趋向宽松

Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

模型评测上下文与知识上下文工程模型行为与机制分析

摘要

自动化检查流水线日益把一个语言模型放在校验者的位置,把另一个(或同一个)模型放在修复者的位置。我们追问:这种接线方式是否会改变校验者的报告。在保持当前任务字节级一致的前提下,测量经过人工验证为正确的ProcessBench轨迹上的误报,我们发现上下文中已存在的一段完整审计到修复的回合,在15个模型×措辞组合中的15个里降低了误报,相比长度匹配的非审计对照降低2.8至11.5个百分点,相对该对照为9%到25%的降幅。这一方向与累积消息文献的预测相反:一个审计报告了错误的回合会进一步降低误报——在该操纵可干净生效的模型上,全部五种措辞均是如此,尽管消极性不对称预测会有更多标记。对回合的分解发现修复内容与审计结论互补:不同组件在不同模型家族上承载这一效应。信号检测分析把这一变化定位于阈值而非辨别力——判断标准在15个组合中的15个中移动并在13个中经校正后依然显著,而d'在任何一个组合中都不显著(尽管d'检验的构造敏感性只有一半)——对50个误报的人工审计发现其中82%本来就是错的,因此在这一工作点上该偏移未必有害。在开启推理的情况下,该效应在两个受测模型上保持相对幅度,阈值解读在那里同样成立。