论文
能把LLM从自循环中拉出来吗——经激活转向的细粒度推理控制
Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering
摘要
扩展推理已成为前沿大语言模型(LLM)的标准,但这些模型产生的轨迹在很大程度上不可控。塑造模型推理方式的现有方法是提示级、作用于输入层的方法,对推理过程本身没有细粒度控制。相关工作分析并发现了LLM推理轨迹中的潜在转移动力学。在此基础上,我们对这些状态做统计刻画,并证明失败轨迹会陷入自循环——耗尽token预算却没有向最终答案推进。为干预这类失败,我们提出SOPHIA:经隐状态干预与激活的推理过程转向。我们把每条推理轨迹视为潜在状态序列而非非结构化文本,研究推理时干预能否为自循环推理过程提供细粒度控制:对每个前缀分类到潜在状态、记录步级转移,并据此构建以状态对索引的转向向量库。推理时,控制器推断当前状态,给定目标状态检索对应向量,还可从转移结构在线检测自循环、防止模型沉入推理黑洞。大量实验表明,该方法可靠地干预自循环失败,转向向量可泛化到不同状态对;终端任务准确率与token效率表明细粒度可控性带来更好的推理质量。
