论文
Interactive Benchmarks
摘要
由于饱和度、主观性和普遍性差,标准基准变得越来越不可靠。我们认为评估模型主动获取信息的能力对于评估模型的智能很重要。我们提出了交互式基准,这是一种统一的评估范式,用于评估模型在预算约束下的交互过程中的推理能力。我们通过两种设置实例化该框架:交互式证明,其中模型与法官交互以推断逻辑和数学中的客观事实或答案;互动游戏,其中模型进行战略性推理,以最大化长期效用。我们的结果表明,交互式基准提供了对模型智能的稳健且忠实的评估,表明交互式场景中仍有很大的改进空间。项目页面:https://github.com/interactivebench/interactivebench
