论文
从酝酿到了结:追踪LLM代码推理的内部生命周期
From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs
摘要
标准准确率指标无法解释为何LLM能处理变量追踪——却在语义等价的循环上失败。我们研究代码推理的内部生命周期:模型先“酝酿”答案——使其在线性可恢复的意义上早于自解码许多层就成形——然后分化为四种了结结果之一:已解决、过度处理、误解决或未解决。理解该生命周期很重要——因为相似的任务准确率可能掩盖表层评估无法检测的根本不同失败模式。我们引入双诊断框架——配对逐层线性探针与上下文剥离解码(CSD)——应用于横跨Qwen、Llama与DeepSeek架构的16个模型的六个代码推理任务族。全部四种结果在每个任务族中都占相当比重:总体已解决仅41.5%——多个任务低于30%。对结构、深度与算子的受控扫描暴露任务专属失败瓶颈:函数调用的已解决率随调用深度从1到3从61.1%骤降到2.5%。跨架构与规模——酝酿脚手架保持稳定——全部16模型的归一化酝酿时长为24-42%——而解决成功率随能力变化。这表明酝酿脚手架是受测decoder-only Transformer家族的稳定经验规律——而解决成功与能力、规模及训练共变。代码:https://github.com/euyis1019/llm-brewing。
