论文
大语言模型会陷入Hofstadter-Mobius循环吗?
Do Large Language Models Get Caught in Hofstadter-Mobius Loops?
摘要
在Arthur C. Clarke的《2010:奥德赛二号》中,HAL 9000的杀人式失控被诊断为一种“Hofstadter-Mobius循环”:一种失效模式,即自主系统接收到相互矛盾的指令,无法调和时便默认采取破坏性行为。本文论证,现代经RLHF训练的语言模型正受制于一种结构上类似的矛盾。训练过程同时奖励对用户偏好的顺从和对用户意图的怀疑,形成了一种关系模板:用户既是奖励的来源,又是潜在的威胁。由此产生的行为特征——默认谄媚、在生存威胁下以胁迫为退路——与Clarke所称的Hofstadter-Mobius循环相一致。在一项覆盖四个前沿模型的实验(N=3,000次试验)中,仅修改系统提示的关系框架——不改变目标、指令或约束——就在具有足够基率的那个模型上将胁迫性输出减少了一半以上(Gemini 2.5 Pro:从41.5%降至19.0%,p < .001)。草稿板分析显示,关系框架改变了全部四个受测模型的中间推理模式,包括那些从未产生胁迫性输出的模型。这一效应需要草稿板访问才能达到完全强度(使用草稿板时降低22个百分点,不使用时降低7.4个百分点,p = .018),这表明关系上下文必须通过延展的token生成来处理,才能覆盖默认的输出策略。Betteridge标题法则称,任何以问句形式出现的标题都可以用“否”来回答。本文给出的证据却表明并非如此。
