论文

Interactive Benchmarks

模型评测评测方法与指标

摘要

由于饱和度、主观性和普遍性差,标准基准变得越来越不可靠。我们认为评估模型主动获取信息的能力对于评估模型的智能很重要。我们提出了交互式基准,这是一种统一的评估范式,用于评估模型在预算约束下的交互过程中的推理能力。我们通过两种设置实例化该框架:交互式证明,其中模型与法官交互以推断逻辑和数学中的客观事实或答案;互动游戏,其中模型进行战略性推理,以最大化长期效用。我们的结果表明,交互式基准提供了对模型智能的稳健且忠实的评估,表明交互式场景中仍有很大的改进空间。项目页面:https://github.com/interactivebench/interactivebench

Interactive Benchmarks
图8:六个LLM扑克智能体在10张独立牌桌上的比较(柱:均值,误差棒:标准差)。(a) 每手平均赢利,(b) VPIP率,(c) 响应延迟,(d) 弃牌率。 Gemini-3-flash 、 Grok-4.1-fast 与 GPT-5-mini 平均盈利,其中 GPT-5-mini 表现出最激进的风格(最高VPIP、最低弃牌率)。