论文

LongCoT:长视野思维链推理基准测试

LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning

模型评测基准与评测资源

摘要

随着语言模型越来越多地部署用于复杂的自主任务,它们在更长的时间内准确推理的能力变得至关重要。这种能力的一个重要组成部分是规划和管理一个漫长而复杂的思想链(CoT)。我们推出了 LongCoT,这是一个可扩展的基准,包含 2,500 个专家设计的问题,涵盖化学、数学、计算机科学、国际象棋和逻辑,用于隔离和直接测量前沿模型的长期 CoT 推理能力。问题包括简短的输入和可验证的答案;解决这些问题需要浏览一张包含数万到数十万个推理标记的相互依赖步骤的图表。对于前沿模型来说,每个局部步骤都是单独可处理的,因此失败反映了长期推理的局限性。发布时,最好的模型在 LongCoT 上实现了 <10% 的准确率(GPT 5.2:9.8%;Gemini 3 Pro:6.1%),揭示了当前能力的巨大差距。总体而言,LongCoT 提供了长期推理的严格衡量标准,跟踪前沿模型在较长时间内可靠推理的能力。