论文
当 LLM 停止以下步骤时:语言模型中过程执行的诊断研究
When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models
摘要
大语言模型(LLM)通常在推理基准测试中表现出色,但仅最终答案的准确性并不能表明他们是否忠实地执行了提示中指定的过程。我们引入了用于算术程序执行的受控诊断基准,其中模型被赋予逐步算术程序和两个数字输入,并且必须返回最终计算值。复杂性因过程长度和中间变量的回顾依赖性而异。平均首次答案准确率从 5 步程序的 63% 下降到 95 步程序的 20\%。生成级分析表明,失败通常涉及缺失答案、过早答案、初始错误后的自我纠正以及执行不足的跟踪。这些发现表明,随着算术程序复杂性的增加,执行性能持续下降。