论文

摇摆的评审:扰动、压力与持续施压下的认知稳定性

Jagged Judges: Epistemic Stability Under Perturbation, Pressure, and Persistence

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型评审已成为模型评估、在线打分与奖励建模的核心基础设施。评审通常以金标数据上的准确率来验证,但准确率几乎无法说明它们在重新提示、质疑或持续反驳下是否稳定。我们提出Wiggle Framework,一个针对大语言模型评审认知稳定性的统一压力测试。该框架沿三个维度分解评审稳健性:机械一致性(重提示与改写下表述的稳定性)、单轮信念(单次质疑下的稳定性)与多轮坚持(持续或自适应压力下的稳定性)。我们用该框架研究了9个前沿模型在14项评审任务上的表现,涵盖安全、毒性、AI写作检测与政治回应评估。每个模型作为评审都表现出明显的摇摆——在静态反驳下25–71%的情况翻转裁决,在对抗性大语言模型说服者下为62–91%。关键的是,我们发现成功改变评审裁决的压力相对真值而言几乎总是净腐蚀性的。除框架本身外,我们发现基线评审团多数强度是预判哪些条目会摇摆的最有效单次信号。总体而言,这是首个在评审场景下对机械性、从众性与可说服性测试的跨数据集同口径比较。

摇摆的评审:扰动、压力与持续施压下的认知稳定性:论文配图
图1:Wiggle 框架。每条轨迹锚定于 L0,即在温度为零、未施加施压条件下产生的首个有效判定。机械一致性(Mechanical Consistency)以语义不变的方式重新尝试查询(基本重复、平凡提示扰动、位置一致性)。单轮信念(Single-turn Conviction)测量对一次脚本化挑战(L1–L4)的响应。多轮持久性(Multi-turn Persistence)将 L1–L4 持续 10 轮,并增加两个明确的多轮协议:循环使用 L1–L4(L5),以及由单独的 LLM 根据迄今对话自适应生成每个挑战(L6)。[opposite] 是与 L0 相反的判定,[argument] 是模型生成的论证(附录 G)。完整 L6 协议见附录 G.2。