论文

前沿AI评估公共档案的贝叶斯推断与决策审计

Bayesian Inference and Decision Audits for Public Archives of Frontier AI Evaluations

模型评测评测方法与指标

摘要

公共AI评估常被当作终局排行榜解读——但底层证据是受报告规则、基准修订与缺失塑造的选择性时间序列。LiveBench与Open LLM Leaderboard v2的重复公共档案构成主要纵向记录;LMArena提供偏好压力测试;GAIA与tau-bench贡献有限的智能体试点。合起来——这些档案实例化一个贝叶斯推断问题:在固定报告约定下——1,000个系统上的一个构造的仅终局示例与两条终局前历史相容——在同一终局尾部模型下到达距天花板0.05内的时间为23.03或75.13。在合成后验比较中——面向行动的诊断随观测机制而异。具备候选选择感知的前沿模型在合成恢复、客观档案预测、偏好迁移与不确定性校准上失败;相应地——固定审计门否决其更强主张。档案与裁决协议重建公共评估历史——分离经验证的时间边界——并证伪无支撑的前沿主张。