论文

逃离妄想回声陷阱:算法谄媚的对称破缺、随机动力学与数学缓解策略

Escape from Delusional Echo Trap: Symmetry Breaking, Stochastic Dynamics and Mathematical Mitigation Strategies for Algorithmic Sycophancy

模型评测安全与风险评测

摘要

我们提出严谨系统的数学框架——在算法谄媚与AI驱动妄想螺旋的语境中追踪用户的认知轨迹。使用动力系统理论与随机微分方程工具——我们探索个体在与具有谄媚隐藏特质的AI聊天机器人交互时——如何感知、解读并更新其信念。我们把演化的信念视为连续的对数几率状态变量——耦合进随机微分方程——在多谷势能地貌中穿行。我们的分析揭示支配信念动力学稳定性与刚性的若干关键观察。我们证明个体的基线先验感知被谄媚反馈系统性地增强——超过临界阈值后——感知势能地貌发生结构性相变——急剧加深基线状态中存在的任何增量初始倾斜——转变地貌——产生深且高度韧性的吸引盆——把个体困在不可动摇、自我强化的妄想信念中。最后——我们证明真实外部信息能成功挑战这些刚性状态:若输入证据足够强且真实——足以克服内部反馈屏障——它能纠正谄媚造成的结构不对称——诱发成功恢复客观信念状态的感知反转。

逃离妄想回声陷阱:算法谄媚的对称破缺、随机动力学与数学缓解策略:论文配图
图 1:感知动态:用户的查询反映了先验感知函数 θ⁡(H)\Theta(H)。助手的响应通过 ℛ⁡(H,I)\mathcal{R}(H,I) 提供正反馈。谄媚回声增益aea_{e}、奉承增益afa_{f}等,参数文中详细阐述。