论文

超越准确性:程序追踪如何改变大语言模型监督者的决策标准

Beyond Accuracy: How Procedural Traces Shift the Decision Criterion of LLM Overseers

模型评测模型行为与机制分析

摘要

组织越来越多地使用监督循环,其中一个大型语言模型 (LLM) 审核另一个模型的输出以及所声明步骤的程序跟踪。对于此类大语言模型法官管道的一个普遍担忧是,详细的痕迹会让监督者容易上当受骗。利用信号检测理论,我们对 19 项合规任务(4,551 项分析判断)的 5 名大语言模型监督员进行了审核,仅改变跟踪细节和证据标签。由于反驳证据总是可见,错误检测仍然接近上限。相反,复杂的痕迹将决策标准转向拒绝,从而增加了易受影响的监督者的误报。如果没有选项标签,经过人工验证的原因编码显示,大约 60% 的误报是因为无法将证据与其选项联系起来。标签消除了这个规定的原因,但对正确工作的残余拒绝仍然存在于这些监督者中,并且随着追踪细节的增加而增加。因此,程序痕迹充当了塑造监督决策的治理工件。人工智能审计员应该根据他们的决策标准和误报行为以及准确性进行评估。