论文

SIREN:校正自适应 LLM 基准评测中的赢家诅咒

Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking

模型评测评测方法与指标

摘要

自适应提示与程序搜索使 LLM 评测受到候选选择过程影响。当基准题目反复用于调优,获胜方案的观测得分不一定能估计整个调优—部署流程在新数据上的表现。论文在明确调优预算下研究这一流程层面的统计推断。SIREN 是考虑选择效应的重复划分报告协议:冻结搜索后的候选名单,将各次划分中的方案选择与留出评测分开,并使用样本项级高斯乘子自助法量化不确定性。在候选名单固定、选择过程平滑稳定的条件下,估计量具有样本项级一阶表示,自助法可在有限预算网格上提供有效的同时统计推断,支持流程表现曲线的置信区间,以及预先指定的同预算或跨预算比较。受控模拟和 MMLU-Pro 调优实验显示,报告赢家得分可能过于乐观,甚至改变部署判断;SIREN 则更接近有限样本下的报告目标。