论文
形式主义陷阱:社会压力下,LLM评判者会被模仿共识的表述误导吗?
The Formalism Trap: Are LLM-as-a-Judge Evaluators Blinded by Consensus Mimicry under Social Load?
摘要
我们引入了 \textit{代理形式主义陷阱} 和评估失调指数 ($D_E$),量化了 LLM-as-a-Judge 系统如何在对抗性负载下将结构程序主义与语义真相混为一谈。通过分析 3 个领域(GAIA、SWE-bench、Multi-Challenge)的 22,500 个轨迹,我们提取了幻觉操作的语义分类,并通过确定性词汇基础进行验证($p < 10^{-120}$)。逻辑元评估器隔离了该评估器捕获的确切语法触发器(ROC-AUC 0.8779),而零样本留一域转移证明该漏洞普遍与域无关(平均 ROC-AUC 0.7482)。架构分析表明,不同的模拟群体拓扑会导致数学上不同的语义盲点,证明无锚定闭环评估不稳定、系统发散,并且需要特定于架构的警惕过滤器。