论文

停止猜测何时停止测试:利用足够的数据进行有效的模型评估

Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data

模型评测评测方法与指标

摘要

固定大小基准的固有刚性使其成为模型评估的低效工具。不同的评估目标,包括模型排名、模型选择和整个开发过程中的测试,需要不同水平的统计能力。固定样本量与这些多样化需求之间的不匹配会导致计算成本过高或可靠性受损——这是模型评估的一个关键问题。为了克服这些限制,我们呼吁在我们的领域采用顺序测试。我们提供了一个自适应评估框架,它提供了一种原则性的方法来平衡模型评估中的效率和可靠性之间的关系。我们的框架将已建立的序贯测试统计范式与针对常见评估需求(例如收益递减检测和最小可检测效应大小)量身定制的停止标准结合起来。我们在 Open VLM 排行榜上展示了其自适应管理效率与可靠性权衡的能力,例如,与固定大小评估(具有 2.5 点 CI 宽度裕度)相比,计算成本降低了 80%,同时保持了统计显着性。