论文
大语言模型的推理结构
Reasoning Structure of Large Language Models
摘要
大型推理模型 (LRM) 通常使用最终答案准确性或标记计数等指标进行评估。然而,这些指标的相同分数可能隐藏根本不同的推理结构。为了解决这个限制,我们引入了逻辑难题的可扩展 LRM 基准测试以及将非结构化跟踪转换为可验证的声明和依赖关系推理图的管道。这将推理变成了一个结构化的、可测量的对象,其拓扑结构可以定量分析。在此基础上,我们定义了一个推理效率指标,用于量化模型逻辑流的集中程度。我们对开源推理模型的分析表明,结构测量将标记计数和准确性合并的行为分开,为诊断故障模式并比较推理与谜题难度的扩展方式提供了实用工具。
