论文

递归LLM循环中的扰动剂量响应:追加、替换与对话更新下的原始切换、随机下限与持续逃逸

Perturbation Dose Responses in Recursive LLM Loops: Raw Switching, Stochastic Floors, and Persistent Escape under Append, Replace, and Dialog Updates

模型评测模型行为与机制分析

摘要

递归语言模型循环通常会陷入可识别的类似吸引子的模式。实际问题是需要多少注入文本才能将已确定的循环移动到其他位置,以及该移动是否持续。我们通过将模型与上下文更新规则分开,在 30 步递归循环中研究这一点:追加、替换和对话更新将不同的历史记录暴露给同一生成器。主要结果是追加模式递归循环中的持久重定向是受内存策略限制的。在 12,000 个字符的尾部剪辑下,在剂量 400 时,目的地相干持久性稳定度接近 16%,保留源盆地逃逸率接近 36%;两者都没有超过 50%。在全历史协议下,保留的源-流域逃逸在 400 个token附近跨越 50%,并在 1,500 个token处达到 75-80% 饱和,而目的地相干持久性首先在接近 1,500 个token时达到 0.50,威尔逊 95% CI 为 [0.41, 0.61]。对于原始切换,对抗性延续产生接近 40 个token的 ED50,配对控制层接近 35%,而净切换在 5-400 个token内从未达到 +50 个百分点。替换模式原始切换接近饱和,但很大程度上反映了状态重置覆盖:插入模式探针将其降至 12-32%。均匀扰动控制再现了目的地相干持久性的高剂量非单调下降,反驳了扰动异质性作为原因;该倾角似乎是结构性的,但机制尚未解决。我们报告了 37 个关于 gpt-4o-mini 的实验,并在 gpt-4.1-nano 上进行了供应商内复制。递归循环评估应区分瞬时移动和持久逃逸,减去随机楼层,并将上下文更新规则视为一流的安全相关设计选择。

递归LLM循环中的扰动剂量响应:追加、替换与对话更新下的原始切换、随机下限与持续逃逸
图 1:标题剂量反应:原始切换和内存策略条件下的持续逃逸。两个面板。 (A) 规范有限记忆循环中的原始切换剂量反应,比较剂量 5-400 个标记的方案 × 内容(D1/中性、O1/中性、O1/对抗性)。替换模式机制 O2/O3 被排除在外,因为默认的状态重置覆盖协议使其在状态写入步骤中切换同义反复( X t + 1 = Clip ⁡ ( perturbation_text ) X_{t+1}=\operatorname{clip}(\text{perturbation\_text}) ;参见 §5.2 和图 6)。 (B) 三种定义下 O1 对抗性的持续逃逸剂量反应。有限记忆,目的地相干持久性(12K 尾夹;轨迹在最后一步保持在注射后簇中;蓝色方块)在剂量 5-400 期间稳定在 16%。全历史、目的地一致的持久性(红色圆圈,剂量 20-400 时的 n=200 与 600-3000 时的 n=100 合并)首先在剂量 1500 时达到 0.51,然后在 2000-3000 时变得非单调。全历史、保留的源盆逃逸(在最终步骤被踢到预注入簇之外;紫色三角形)是单调和饱和的:它在剂量 300-400 之间跨越 50%,并在剂量 1500 时饱和到接近 75-80%。高剂量下的目的地相干下降并不是位移损失(在剂量下踢出率保持为 0.96) ≥1500);它是递归循环高剂量响应的结构(均匀扰动控制再现下降;参见§5.1.3)。有界内存平台适用于两个端点(第 5.1.3 节/图 5 中的完整细分)。来源:data/aggreated/perturbation_dose_response/dose_response_2panel.png 。图 1 总结了两个剂量反应结果。图 A:规范有限内存循环中的原始切换方向。 D1/中性在最小剂量时饱和(5 个标记时为 62%),O1/中性保持在噪声基底(22-26%),O1/对抗性在 200 个标记时剂量上升至 54% - 相同的循环,对分布内文本和离题文本的敏感度不同。 B组:三个终点下的持续逸出剂量反应(有界目的地相干、全历史目的地相干、全历史源盆地逸出)。剂量 5-400 期间,有限记忆平台期为 16%;全历史源流域逃逸在 400 个token附近跨越 50%,并饱和 75-80%;全历史目的地一致性首先在接近 1,500 个token时达到 50%,但在更高剂量时是非单调的。非单调性是高剂量下递归循环的结构(均匀扰动控制再现它;§5.1.3),并且不是位移损失(踢动率保持 0.96)。伪造结果:D1 在小剂量下不饱和,O1/对抗性在任何剂量下不超过 O1/中性,或有界曲线和全历史曲线在 B 组中重叠。完整的分解和分解表见 §5.1.3。