论文

AIMO可解释性挑战赛

AIMO Interpretability Challenge

模型评测基准与评测资源

摘要

我们提出AIMO可解释性挑战赛:一项基于内部机制、区分前沿数学语言模型中稳健推理与虚假推理的竞赛。该挑战的动机是标准推理基准的一个核心局限:强的最终答案准确率不能揭示模型依赖稳定的推理机制,还是利用脆弱的推理捷径。基于AI数学奥赛(AIMO)问题与提交、连同Fields模型倡议的资源,竞赛将提供:(1) 新发布的奥赛级数学推理问题及其符号表示——可生成新颖的功能变体;(2) 前沿推理模型的访问;(3) 模型在这些问题上对抗鲁棒性的评估。参赛者将利用这些资源与我们提供的计算基础设施支持,开发识别哪些模型稳健解题的方法。竞赛还将创建新的开放鲁棒性基准与基线系统——为数学推理与可解释性的标准基准测试提供持久基础。科学上,竞赛把可解释性与泛化研究连接到AI研究的中心问题:我们能否判断、以及在何种程度上判断前沿AI模型的决策是可泛化的,从而是可靠的?