论文
一个神经元何时可以修复 LLM 中的重复循环?
When Can One Neuron Fix Repetition Loops in LLMs?
摘要
Gemma 4 指令调整模型有一个可重现的失败:在较长的事实枚举提示中,例如电视剧集、88 个 IAU 星座或 151 个原始 Pokemon,它们会陷入重复,要么是一个严格的逐字循环,要么是一个条目衰减为一个答案的列表。这些循环达到 87.5%(7/8 代),并且能够在及时的改写和大多数采样调整中幸存下来。在本文中,我们探讨了对一些内部模型组件的编辑是否可以直接减少这种失败,而不依赖于重复惩罚,因为重复惩罚可能会扭曲有效重复并降低任务性能。为了找到这样的目标,我们将每层消融与每个神经元或路由专家归因相结合,然后评估整个世代的权重编辑。我们发现这些编辑大大减少了在提示和用于选择它们的种子上检测到的循环;例如,在 Gemma 4 E2B 中,一个符号反转的神经元就足够了。在所有四个 Gemma 模型中,在冻结的保留提示和种子上,检测到的循环从 46/384 下降到 12/384,主要由 E4B 和 31B 驱动,而通用基准测试显示没有统计上可检测的回归。我们的归因方法可以识别有用的候选人,但排名因示例而异。在较长的世代预算中,编辑对于 E2B 和 E4B 仍然有效,而 26B 和 31B 中的剩余失败则转向厄运循环:对模型无法回忆的事实进行非收敛的自我纠正。在 Qwen3.5 和 LFM2.5 的探索性实验中,稀疏编辑也减少了重复,提供了初步的跨科证据,尽管效果强度和选择性有所不同。总的来说,我们的结果显示了有针对性的小规模权重编辑的前景和局限性:它可以抑制特定的重复失败并提供 无需训练 因果干预,但不能揭示通用循环电路,保证干净终止或提供缺失的知识。