论文

玩读心术:用思维树预测推理模型在编码任务上的准确率

Playing Psychic: Using Thought Trees to Predict Reasoning Models Accuracy on Coding Tasks

模型推理推理验证与自校正

摘要

大语言模型(LLM)的最新进展表明,测试时扩展可显著提升模型在复杂任务上的表现,尤其是在编码领域。在该范式下,模型在推理时使用更大的token预算,在给出最终答案前生成中间推理轨迹。然而,当前评估主要依赖竞赛编程基准,可能无法覆盖全部推理能力。本工作对前沿推理模型进行系统研究,以理解其在真实世界编码基准上的表现。为更深入洞察此类模型的表现,我们设计了一种程序化方法,从现有基准自动生成任意难度与结构的编码任务。利用该框架,我们的分析揭示:推理轨迹的结构(而不仅是内容)是正确性的有力预测因子。受此启发,我们提出结构化思维树作为表示推理轨迹的手段。为展示其用途,我们在从思维树提取的特征上训练一个轻量分类器来预测轨迹正确性,并证明基于提取特征标记并重试结构异常的轨迹,能在较低复杂度层级带来一致增益。

玩读心术:用思维树预测推理模型在编码任务上的准确率:论文配图
R1编程任务推理轨迹的特征相关性:(a)CRUXEval心理执行与词数关系,(b)CodeLingua代码密度与平均片段长度。