论文
使用项目响应理论审核 LLM 基准
Auditing LLM Benchmarks with Item Response Theory
摘要
LLM 基准测试标签在发布时被冻结,并默默地传播到下游基准测试、错误等。我们引入了一个基于项目响应理论的指标,该指标使用来自 114 个模型的响应,以 95% 的精度在七个偏好和多项选择基准的前 200 个示例中显示可能的错误标签,其性能优于监督分类器。我们将这些错误追溯到机械标签启发法、从源数据集继承而来的上游注释错误,以及没有可防御的单一标签的根本上不明确的项目。相同的模型拟合表明,奖励模型专注于风格偏好而不是事实知识,并确定了一种前沿奖励模型,该模型与检测到的错误标签一致,准确度为 78%,而同行的准确度为 38%,这与基准污染或基准特定的过度优化一致。