论文
结构锚点和推理脆弱性:理解 LLM4Code 中的 CoT 稳健性
Structural Anchors and Reasoning Fragility:Understanding CoT Robustness in LLM4Code
摘要
思想链 (CoT) 提示广泛用于从 大语言模型 代码 (LLM4Code) 中引出显式推理。然而,它对现实输入扰动下推理轨迹的鲁棒性和稳定性的影响仍然知之甚少。之前的工作主要通过最终的正确性来评估 CoT,在理解 CoT 如何重塑内部不确定性动态以及为什么它有时会损害而不是帮助代码生成方面留下了关键的空白。我们认为 CoT 并不总是有益的;相反,它的稳健性取决于扰动是否会破坏推理到代码轨迹上结构敏感的承诺点的稳定性。我们对六个模型和两个代码基准(MHPP 和 BigCodeBench)进行了受控的大规模 CoT 实证研究,使任务文档字符串受到系统的字符、单词和句子级别的扰动。我们用 词元级 不确定性来检测完整的生成轨迹,并定义三个新颖的结构锚:推理代码转换、符号承诺和算法表达。研究结果:(1) CoT 不会产生统一的性能或鲁棒性增益:它的好处取决于模型系列、任务结构和提示明确性。 (2) CoT 和 No-CoT 表现出不同的稳健性特征,不同的扰动族会触发不同的故障模式。 (3) 我们确定了三种循环轨迹变形——延长、分支和简化——当扰动与结构锚相互作用时系统地出现并解释失效模式。 (4) 早期不确定性可作为可靠的诊断信号,用于定位敏感锚点周围轨迹不稳定的起始位置。这些结果为 CoT 的混合性能提供了统一的解释,并提出了构建更强大的基于推理的代码生成器的设计原则。