论文
摇摆的评审:扰动、压力与持续施压下的认知稳定性
Jagged Judges: Epistemic Stability Under Perturbation, Pressure, and Persistence
摘要
大语言模型评审已成为模型评估、在线打分与奖励建模的核心基础设施。评审通常以金标数据上的准确率来验证,但准确率几乎无法说明它们在重新提示、质疑或持续反驳下是否稳定。我们提出Wiggle Framework,一个针对大语言模型评审认知稳定性的统一压力测试。该框架沿三个维度分解评审稳健性:机械一致性(重提示与改写下表述的稳定性)、单轮信念(单次质疑下的稳定性)与多轮坚持(持续或自适应压力下的稳定性)。我们用该框架研究了9个前沿模型在14项评审任务上的表现,涵盖安全、毒性、AI写作检测与政治回应评估。每个模型作为评审都表现出明显的摇摆——在静态反驳下25–71%的情况翻转裁决,在对抗性大语言模型说服者下为62–91%。关键的是,我们发现成功改变评审裁决的压力相对真值而言几乎总是净腐蚀性的。除框架本身外,我们发现基线评审团多数强度是预判哪些条目会摇摆的最有效单次信号。总体而言,这是首个在评审场景下对机械性、从众性与可说服性测试的跨数据集同口径比较。
