论文
General365 将通用推理与专业知识区分评测
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
摘要
当代大语言模型在数学、物理等专业领域表现出显著推理能力,但它们能否将这些能力泛化至更广泛的一般情境,即“通用推理”,仍未得到充分研究。与领域专用推理不同,通用推理较少依赖专业知识,却仍面临复杂约束、嵌套逻辑分支及语义干扰等难题。我们提出General365,专门评估大语言模型的通用推理能力。该基准将背景知识限制在基础教育K–12水平,明确将推理能力与专业知识区分开来;包含八类任务的365道种子题及1,095道变体题,兼顾难度与多样性。对26个领先模型的评估发现,最强模型准确率也只有62.8%,与其在数学及物理基准上接近满分的表现形成明显差异。这说明现有模型的推理能力高度依赖领域,广泛应用中仍有明显改进空间。我们希望General365推动推理能力从领域专用任务走向稳健、通用的真实场景。代码、数据集和榜单见https://general365.github.io。