论文

AI评测生态:榜单设计如何影响实际使用效果

The AI Evaluation Ecosystem

模型评测智能体系统Agent 协作评测方法与指标

摘要

人工智能评估影响模型提供者、用户、资助者和监管者的决策。我们认为,设计有效的基准需要将设计选择融入到参与者生态系统的动态中。我们开发了一种模拟架构,它将基于规则的市场动态与LLM驱动的战略参与者相结合,以基于生成Agent的建模 (GABM) 的进步为基础。我们将基准、消费者需求和提供商能力建模为六维能力空间(推理、编码、知识、安全、通信、Agentic)上的向量,并在参与者之间进行结构信息划分。作为案例研究,我们应用这种程式化的模拟来探索基准测试设计。我们发现,从公共基准转向私人留出集基准,在大多数基准上缩小了基准分数和用户满意度之间的差距,但在少数基准上扩大了差距,具体取决于留出集权重转移评分信用的位置。我们利用 Sargent (2013) 的 V&V 框架和 GABM 特定的证据标准,在工具和案例研究层面对我们的发现进行了压力测试。除了留出集设计之外,我们的模拟是一个假设生成沙箱,用于研究评估者和政策选择如何重塑生态系统。

AI评测生态:榜单设计如何影响实际使用效果:论文原图
图 8:启发式隐私阶梯:市场领导者基准分数与匹配的消费者满意度可靠性,汇集了来自 N=50N{=}每个条件 50 个种子的 87,61787{,}617 个领导者行 ×\times 5 个隐私条件。对角线==完美校准;对角线以下 == 基准过度承诺。 (a) 按基准以及每个基准超额承诺率进行着色; (b) 按隐私条件和每个条件过度承诺率着色。可靠性与图3中的聚合云和§5的维度结构一致。