论文

从酝酿到了结:追踪LLM代码推理的内部生命周期

From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs

模型评测模型行为与机制分析

摘要

标准准确率指标无法解释为何LLM能处理变量追踪——却在语义等价的循环上失败。我们研究代码推理的内部生命周期:模型先“酝酿”答案——使其在线性可恢复的意义上早于自解码许多层就成形——然后分化为四种了结结果之一:已解决、过度处理、误解决或未解决。理解该生命周期很重要——因为相似的任务准确率可能掩盖表层评估无法检测的根本不同失败模式。我们引入双诊断框架——配对逐层线性探针与上下文剥离解码(CSD)——应用于横跨Qwen、Llama与DeepSeek架构的16个模型的六个代码推理任务族。全部四种结果在每个任务族中都占相当比重:总体已解决仅41.5%——多个任务低于30%。对结构、深度与算子的受控扫描暴露任务专属失败瓶颈:函数调用的已解决率随调用深度从1到3从61.1%骤降到2.5%。跨架构与规模——酝酿脚手架保持稳定——全部16模型的归一化酝酿时长为24-42%——而解决成功率随能力变化。这表明酝酿脚手架是受测decoder-only Transformer家族的稳定经验规律——而解决成功与能力、规模及训练共变。代码:https://github.com/euyis1019/llm-brewing。

从酝酿到了结:追踪LLM代码推理的内部生命周期:论文配图
图 1:从酝酿到解决的生命周期(Qwen2.5-Coder-7B,计算)。每个面板显示一个跨层的样本轨迹:当答案是线性可读时的探测标记,当模型可以从剥离的上下文中解码它时的 CSD 标记,以及最终的输出确定是否保留或覆盖联合正确的轨迹。 FPCL和FJC定义冲泡间隔;样本级结果根据 FJC 存在性、最终正确性和尾窗 CSD 置信度分配。