论文

从推理中寻找真相:转向LLM轨迹的动态表示编辑框架

Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories

模型推理推理验证与自校正

摘要

当前增强大语言模型(LLM)推理的方法——如思维链与“等等”提示——主要鼓励模型想更多——但常未能引导它们走向真相。虽然表示编辑(RepE)提供内在控制——其在动态推理轨迹上的应用仍少被探索。本工作中——我们通过研究展开推理链内真相的几何来弥合该缺口。我们发现三个关键洞见:(1) 真相在句子级编码——并与潜在推理模式纠缠;(2) 有效干预遵循不确定性原理与衰减效应——需要定位到早期、高熵分叉;(3) 朴素转向向量受噪声影响——有对正确轨迹附带损害的风险。基于这些发现——我们提出DynaSteer——动态RepE框架。DynaSteer用模式聚类解缠推理流形——用Fisher-LDA投影提纯真相。通过动态监测前瞻熵——它仅在必要时选择性地转向与回滚轨迹。在多个MATH基准上的综合实验结果验证DynaSteer有效性——域外编码任务实验进一步确认其泛化能力。代码公开于 https://github.com/tianlwang/DynaSteer。

从推理中寻找真相:转向LLM轨迹的动态表示编辑框架:论文配图
图 1:说明 (a) 现有推理干预方法、(b) 静态表示编辑和 (c) 推理轨迹期间的动态表示编辑之间的主要区别。