论文

Relay-Bench:在多域推理链上评估 LLM

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

模型评测基准与评测资源

摘要

隆重推出 Relay-Bench,这是一个不饱和、整体、纯文本的基准测试,用于衡量 LLM 在单个提示中完成不同领域的各种任务的能力。领先的模型 GPT-5.5 (xHigh) 得分为 43.3%。测试集完全由复合问题组成:单域子问题组串在一起形成需要跨多个域进行组合推理的挑战。这些问题中的许多都通过即时编码和故意的上下文膨胀而增加了层层复杂性。测试的领域包括视觉推理、编码、数学、信息提取(重点是网络搜索)、问题解决、常识和数据分析。在模型利用之外没有任何限制,并且明确鼓励模型利用代码执行、网络搜索和所有可用的工具。所有问题都由两到十三个子问题组成,不需要多模态输入或输出。