论文

理解边缘处的基准测试

Benchmarking at the Edge of Comprehension

模型评测评测方法与指标

摘要

随着前沿大语言模型(LLM)越来越快地在基准发布后不久使其饱和,基准测试本身正处于转折点:如果前沿模型持续改进,人类将越来越难以生成有区分力的任务、提供准确的真值答案或评估复杂的解答。如果基准测试变得不可行,我们衡量 AI 任何进展的能力将岌岌可危。我们将这种情形称为“后理解”(post-comprehension)状态。在本工作中,我们提出 Critique-Resilient Benchmarking,一个即使在人类无法完全理解任务的情况下也能比较模型的对抗性框架。我们的技术依赖于“抗批判正确性”概念:如果没有对手令人信服地证明某答案错误,则该答案被视为正确。与标准基准测试不同,人类作为有界验证者只关注局部论断,从而在无法完全理解任务的情况下仍保持评估的完整性。利用分项二部 Bradley-Terry 模型,我们按 LLM 解决挑战性任务的能力和生成困难但可解问题的能力对其进行联合排名。我们在数学领域跨八个前沿 LLM 展示了该方法的有效性,所得分数稳定并与外部能力度量相关。我们的框架将基准测试重新表述为对抗性生成-评估博弈,其中人类担任最终裁决者。

理解边缘处的基准测试
图2:人类评估者与模型之间的一致率