论文

QuickScope:验证动态 LLM 基准中的难题

QuickScope: Certifying Hard Questions in Dynamic LLM Benchmarks

模型评测评测方法与指标

摘要

LLM 基准测试越来越动态:它们定义的模板和参数可以有效生成无限数量的问题变体,而不是包含一组固定的问题。这种灵活性很有价值,但它使得评估成本高昂——尤其是当目标不仅仅是确定平均分数,而是可靠地识别模型的弱点时。本文介绍了一种识别动态基准中的难题的新方法。它利用了 COUP,这是一种最新的贝叶斯优化算法(Graham、Velez & Leyton-Brown,2026),在引入了一些实质性修改以使该算法适合实际的 LLM 管道之后。我们还将其包装在一个支持灵活选择数据集和实用函数的工具中,使用户能够针对他们关心的问题类型(例如,低准确度问题;相对于其测量的复杂性而言异常困难的问题)。在一系列基准测试的实验中,我们表明,我们的方法(称为 $\texttt{QuickScope}$)比标准基线更有效地发现真正困难的问题,同时还减少了噪声结果中的误报。