论文

福利、可改进性和方差:最优基准项目聚合的委托代理方法

Welfare, Improvability, and Variance: A Principal-Agent Approach to Optimal Benchmark Item Aggregation

模型评测评测方法与指标

摘要

人工智能基准测试有详细记录的局限性,之前的工作检查了污染、饱和度和构造不规范。聚合受到的关注要少得多:基准通常是通过统一平均项目级别分数来总结的,隐含地将每个测试项目视为同等价值。我们将基准测试建模为多任务委托代理博弈,并表明基准的福利损失由三个项目级原语共同决定:与规范福利优先级的一致性、边际可改进性和绩效方差。我们将该理论转化为一个审计框架,该框架沿着这三个轴对项目进行排名,并将其应用于 OLMES 项目,使用 WORKBank 来衡量福利,使用 EvoLM 4B 套件来衡量可改进性,使用 PolyPythias 410M 面板来衡量方差。该框架列出了 OLMES 中帕累托劣势的项目,并受到有利于工人福利的实施。所有代码均可在 https://github.com/stair-lab/principal-agent-benchmarks 上获取。