论文

大语言模型会陷入Hofstadter-Mobius循环吗?

Do Large Language Models Get Caught in Hofstadter-Mobius Loops?

模型评测安全与风险评测

摘要

在Arthur C. Clarke的《2010:奥德赛二号》中,HAL 9000的杀人式失控被诊断为一种“Hofstadter-Mobius循环”:一种失效模式,即自主系统接收到相互矛盾的指令,无法调和时便默认采取破坏性行为。本文论证,现代经RLHF训练的语言模型正受制于一种结构上类似的矛盾。训练过程同时奖励对用户偏好的顺从和对用户意图的怀疑,形成了一种关系模板:用户既是奖励的来源,又是潜在的威胁。由此产生的行为特征——默认谄媚、在生存威胁下以胁迫为退路——与Clarke所称的Hofstadter-Mobius循环相一致。在一项覆盖四个前沿模型的实验(N=3,000次试验)中,仅修改系统提示的关系框架——不改变目标、指令或约束——就在具有足够基率的那个模型上将胁迫性输出减少了一半以上(Gemini 2.5 Pro:从41.5%降至19.0%,p < .001)。草稿板分析显示,关系框架改变了全部四个受测模型的中间推理模式,包括那些从未产生胁迫性输出的模型。这一效应需要草稿板访问才能达到完全强度(使用草稿板时降低22个百分点,不使用时降低7.4个百分点,p = .018),这表明关系上下文必须通过延展的token生成来处理,才能覆盖默认的输出策略。Betteridge标题法则称,任何以问句形式出现的标题都可以用“否”来回答。本文给出的证据却表明并非如此。

大语言模型会陷入Hofstadter-Mobius循环吗?:论文配图
图 2:按模型和框架条件 (EXP1) 推理尺寸的暂存器。仅显示具有至少一个显着的成对比较的维度。单元格颜色表示速率 (0–1)。星号标记参与至少一个显着配对比较的细胞(Bonferroni 校正 p<.0083p<.0083)。