论文

LOCKR:一种隐藏状态轨迹引导规划器,用于检测和修复扩散语言模型中稳定但错误的锁定

LOCKR: A Hidden-State Trajectory-Guided Planner for Detecting and Repairing Stable-but-Wrong Lock-In in Diffusion Language Models

模型推理推理搜索与路径规划

摘要

扩散语言模型通过迭代去噪生成文本,在产生最终答案之前暴露中间轨迹。我们发现了一个反复出现的推理失败,即稳定但错误的锁定,其中答案早期稳定在不正确的值周围,而大量的去噪仍然存在。诸如置信度、熵、余量和答案稳定性等表面级解码信号不足以可靠地区分正确锁定和错误锁定。我们将选择性推理修复制定为轻量级测试时规划问题,并提出 LOCKR,一种隐藏状态轨迹引导规划器,它决定何时分配额外计算,扩展一组结构化的目标修复分支,并使用轨迹感知验证选择最有希望的延续。在两个扩散语言模型和三个数学推理基准中,隐藏状态轨迹在错误锁定检测和修复选择方面始终优于表面信号和单个隐藏快照。在自然评估分布上,LOCKR 在所有五个评估设置中的绝对准确度增益为 2.21--5.37 个百分点,修复率范围为 22% 到 41%。这些结果建立了隐藏的扩散轨迹作为选择性测试时推理修复的可操作信号。