论文

IOL-AI 挑战:推进语言推理的公开挑战

The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning

模型评测基准与评测资源

摘要

LLM 中的推理绝大多数是在提供带有规则的模型的领域中研究的:数学和代码。语言难题则相反:解决者必须首先发现系统,然后再在系统中进行推理。我们推出了 IOL-AI 挑战赛,这是一项开放科学竞赛,针对 2026 年国际语言学奥林匹克 (IOL) 个人竞赛中未见过的问题进行,首次由官方 IOL 评审团成员按照与人类参赛者相同的标准进行自动评估。该挑战赛在严格的计算预算(一个 T4,30 分钟)下吸引了来自 46 个团队的 731 份提交。我们还对 15 个不受约束的前沿和开放模型进行了基准测试,其中 Claude Opus 4.8 获得了相当于金牌的评审团评分,而我们提交给评审团评分的两个资源受限系统的得分都在参赛者中排名倒数 5% 的范围内。能力并非由规模决定:14B 提交的性能优于其规模两倍的模型,并且收益来自解码和输出处理而不是模型容量。我们还发现,自动指标对系统的排名与陪审团的排名完全一致,但会压缩规模,将较弱的系统得分提高约 13 分,而低估了较强的系统。我们的分析表明,虽然前沿模型可能具有某些问题语言的先验知识,但它并不能显着帮助他们解决语言推理任务,从而使语言推理成为通用推理技能的强大基准代理。