论文

对数式评分与幂律式发现:在基于Agent的评估中将测量与覆盖解耦

Logarithmic Scores, Power-Law Discoveries: Disentangling Measurement from Coverage in Agent-Based Evaluation

模型评测评测方法与指标

摘要

基于LLM的智能体评审(agent judge)是评估对话式AI的一种新兴方法,但一个根本的不确定性依然存在:我们能否信任它们的评估?如果能,需要多少个?通过在15个任务上对两个模型对开展960场会话,我们证明基于人设(persona)的智能体评审在图灵式验证中产生的评估与人类评分者难以区分。随后我们识别出一种评分-覆盖解离现象:质量评分随评审面板规模呈对数式提升,而独立问题的发现遵循亚线性幂律——两者均表现出收益递减,但评分的饱和速度约为问题发现的两倍。我们假设这反映了发现空间的幂律分布:关键问题首先由小规模面板发现,而边缘情形(corner case)需要逐步更大的面板,类似于生态学中的物种累积曲线。其机制可追溯至集成多样性——大五(Big Five)人格条件化使智能体探测不同的质量维度,专家评审则充当对抗性探针,将发现推向发现分布的尾部。一项受控消融实验证实,要产生这些扩展特性,需要结构化的人设条件化,而非简单的提示词。

对数式评分与幂律式发现:在基于Agent的评估中将测量与覆盖解耦:论文配图
图7:各领域人类评审与智能体裁判(N=480)的Cohen's d效应量:绿色为不显著,总体差异小(d=-0.18)。