论文

自适应效用加权基准测试的理论框架

A Theoretical Framework for Adaptive Utility-Weighted Benchmarking

模型评测评测方法与指标

摘要

基准测试长期以来是机器学习的基础实践,并日益延伸到大型语言模型等现代AI系统中,共享任务、指标和排行榜为衡量进展和比较方法提供了共同基础。然而,随着AI系统被部署在更多样、影响更重大的环境中,用一种更整体的概念化来补充这些既有实践、重新思考评估应当代表什么,其价值不断增长。值得注意的是,承认这些系统所处的社会技术语境,提供了一个更深入审视的机会:多个利益相关方及其各自独特的优先级如何影响我们认为什么是有意义或理想的模型行为。本文引入一个理论框架,将基准测试重新概念化为一个多层、自适应的网络,通过加权交互连接评估指标、模型组件和利益相关方群体。利用源自联合分析(conjoint)的效用和人在回路的更新规则,我们形式化了如何将人类权衡嵌入基准结构,以及基准如何在保持稳定性和可解释性的同时动态演化。所得公式将经典排行榜作为特例加以推广,为构建更具语境感知的评估协议奠定基础,提供了分析基准结构属性的新稳健工具,开辟了通向更可问责、与人对齐的评估的道路。