论文

能把LLM从自循环中拉出来吗——经激活转向的细粒度推理控制

Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering

模型推理推理策略与问题分解

摘要

扩展推理已成为前沿大语言模型(LLM)的标准,但这些模型产生的轨迹在很大程度上不可控。塑造模型推理方式的现有方法是提示级、作用于输入层的方法,对推理过程本身没有细粒度控制。相关工作分析并发现了LLM推理轨迹中的潜在转移动力学。在此基础上,我们对这些状态做统计刻画,并证明失败轨迹会陷入自循环——耗尽token预算却没有向最终答案推进。为干预这类失败,我们提出SOPHIA:经隐状态干预与激活的推理过程转向。我们把每条推理轨迹视为潜在状态序列而非非结构化文本,研究推理时干预能否为自循环推理过程提供细粒度控制:对每个前缀分类到潜在状态、记录步级转移,并据此构建以状态对索引的转向向量库。推理时,控制器推断当前状态,给定目标状态检索对应向量,还可从转移结构在线检测自循环、防止模型沉入推理黑洞。大量实验表明,该方法可靠地干预自循环失败,转向向量可泛化到不同状态对;终端任务准确率与token效率表明细粒度可控性带来更好的推理质量。

能把LLM从自循环中拉出来吗——经激活转向的细粒度推理控制:论文配图
图 1:LRM 推理轨迹中的自循环。该模型尽早计算出正确的值(紫色,64 美元),但在提交之前循环执行冗余验证和重新提问步骤(红色),将预算浪费在已经完成的工作上。方框颜色表示潜在推理状态 K=5​​K=5,这些状态是在无监督的情况下从激活中诱导出来的,而不是从手动定义的思想分类法中分配的 Chen 等人。 (2025),从生成的轨迹中自动发现转换。这使得像上面的循环这样的故障模式可以作为转换事件,其粒度比令牌或提示级别控制所允许的更细。