论文

大语言模型的推理结构

Reasoning Structure of Large Language Models

模型评测评测方法与指标

摘要

大型推理模型 (LRM) 通常使用最终答案准确性或标记计数等指标进行评估。然而,这些指标的相同分数可能隐藏根本不同的推理结构。为了解决这个限制,我们引入了逻辑难题的可扩展 LRM 基准测试以及将非结构化跟踪转换为可验证的声明和依赖关系推理图的管道。这将推理变成了一个结构化的、可测量的对象,其拓扑结构可以定量分析。在此基础上,我们定义了一个推理效率指标,用于量化模型逻辑流的集中程度。我们对开源推理模型的分析表明,结构测量将标记计数和准确性合并的行为分开,为诊断故障模式并比较推理与谜题难度的扩展方式提供了实用工具。

大语言模型的推理结构:论文配图
图 2:推理图提取。 4×\times4 Tents 实例的示例(左)、人类生成的推理轨迹的摘录(中)以及使用第 3 节中描述的管道提取的相应可验证声明图(右)。这说明了我们的管道如何将自由形式的跟踪转换为结构化对象,这些对象可以在准确性和令牌计数之外进行分析。