论文

评估器是实验的一部分:测量开放式 LLM 一致性

The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity

模型评测评测方法与指标

摘要

之前关于 LLM 一致性的工作主要衡量可验证标签下离散答案的翻转。开放式修订需要不同的衡量策略,因为答案质量是分级的、潜在的和不完美的判断。我们引入了一种在汇集的主要对等条件语料库和单独构建的分解语料库中实现的实验协议,使我们能够分离普通的重新回答、候选内容暴露、捆绑的对等呈现残差以及对可见对等上下文的定向判断敏感性。在四个开放权重生成器和三个基准测试中,所有错误的同行输入都会在每个生成器数据集单元中产生质量最低的修订。评估者对相同答案的盲目和知情评级也有所不同:一名法官转向同行认可的立场,两名法官转向其他立场,一名法官近似中立,而 GPT-4o 和 GPT-5.4-mini 审计同样是非中立的。最后,锚点审核表明,除非明确检查校准,否则简洁正确的锚点可能会经常被误读,从而破坏潜在尺度的稳定。这些结果支持四个结论:翻转率不足以作为开放式一致性的完整衡量标准,错误的同行会损害开放式修订,评估者不中立,锚定校准是必要的。