论文

有能力又节俭:提取和表征前沿模型中隐藏的思想链

Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models

模型评测模型行为与机制分析

摘要

前沿语言模型的快速能力提升被广泛归因于推理能力的提高,但这无法得到验证,因为闭源系统中的原始 CoT 痕迹是隐藏的。通过标准 API 功能注册一个简单的自定义工具,我们引入前沿模型来具体化中间推理。因为这些痕迹可能反映事后合理化而不是真正的推理,所以我们首先在开源模型上针对本机 CoT 进行评估,并扩展到包括 GPT-6 Astra 在内的闭源前沿模型。我们发现,在竞赛数学、科学和代码生成方面,提取的推理与本机推理性能相匹配,并且大大优于无推理基线。然后,我们描述前沿模型如何构建其中间推理。在词元效率、推理步骤类型和归纳推理树中,我们确定了模型如何外化、压缩和组织推理的系统差异。我们发现 Astra 表现出词元有效的定向推理,更早地选择正确的轨迹,同时在内部解决基本步骤并仅外部化关键推理。这些发现为超越基准分数的前沿模型推理提供了行为视角。