论文
绘制评估前沿:十一个评估者-代理条件下偏差与可靠性权衡的实证调查
Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions
摘要
偏差-可靠性权衡猜想是,LLM 评估系统受限于 (gamma, H, CV) 空间,其中评估器耦合 (gamma)、策略多样性 (H) 和小样本测量可靠性 (CV(N)) 无法在固定样本量 N 下同时优化。先前的证据依赖于 n=5 的条件,并具有来自单个研究的完整指标。我们将经验基础扩展到 11 个条件,测量所有 11 个条件的 gamma 和 H(9 个具有有效权重向量),以及 7 个具有足够种子 (N >= 5) 的 CV(N=5)。五个条件提供了完整的(gamma、H、CV)三元组。数据证实了这种权衡:低评估器耦合 (gamma < 0.2) 的条件表现出高测量噪声 (CV(N=5) > 1.0),而强耦合 (gamma > 0.9) 的条件实现低噪声 (CV(N=5) < 0.16)。相关性 r(H, gamma) = -0.989(n=5,不包括 GPT-4o 条件)证实评估器耦合抑制策略多样性。四种 GPT-4o 条件显示所有种子的 gamma=0.000 且 H=1.000——我们将这种模式归因于 2026 年 6 月 GPT-4o API 中的版本漂移。没有条件占据区域 {gamma < 0.2, CV(N=5) < 0.3}。我们将所有每个条件的指标发布为标准化基准数据集,以供评估者进行比较。