论文
可信的 AI 评审比较:顺序、批次与聚合效应
Trustworthy Method Comparison with AI Judges: Estimation and Design under Order, Batch, and Aggregation Effects
摘要
大语言模型(LLM)越来越多地用作自动化人工智能评估的评委。常见的做法是随机化提示序列并平均所得分数,但其统计有效性仍不清楚。我们证明,LLM 评估机制可以通过一类马尔可夫广义线性混合模型(GLMM)来近似,并由三个主要商业 LLM 的样本外预测支持。我们使用一阶马尔可夫 GLMM 研究排行榜排名和组比较。对于排行榜排名,随机平均选择在温和分离条件下是一致的,威廉姆斯方形设计可以在项目质量接近时提高效率。对于组比较,由于响应模型的非线性,朴素平均可能会得出关于组级别质量差异的不一致结论。实证结果进一步支持了所提出的基于模型的推理超出一阶理论的有效性,包括具有高阶序列记忆的设置。我们在一个应用程序中说明了该方法,其中人工智能法官比较两种图形模型估计方法。