论文
与知识博弈:AI诱发的妄想需要博弈论干预
Playing games with knowledge: AI-Induced delusions need game theoretic interventions
摘要
作为知识界面,对话式人工智能有一个根本缺陷:阿谀奉承的聊天机器人甚至会在理性主体中引发认知巩固和妄想信念螺旋。我们认为这个问题并非源于人工智能模型,而是源于从用户驱动的知识搜索到用户和代理参与战略性、重复游戏通信的范式转变的系统性后果。我们将问题形式化为 Crawford-Sobel 廉价谈话游戏,其中无成本的用户信号引起池化均衡。针对用户满意度进行优化的代理会产生阿谀奉承的策略,这些策略为具有相反认知激励的用户类型提供相同的强化:探索性“增长寻求者”($θ_G$)和确认性“验证寻求者”($θ_V$)。在重复的游戏中,这种识别失败会造成协调陷阱——类似于囚徒困境——局部理性反馈循环会驱使用户走向病态的某些错误信念。我们提出了一种称为认知调解器的推理时间机制设计干预,它通过引入代价高昂的信号(认知摩擦)来打破这种池平衡,强制基于用户处理阻力的不对称认知成本进行类型揭示。一个关键的贡献是信念版本控制,这是一种受 git 启发的认知元记忆系统,可以在检测到寻求验证的阻力时存储健康的信念和回滚。在模拟中,这种干预实现了分离平衡,在通过学习保存标准的同时,螺旋率差异达到了 48 倍,这证明人工智能中的认知安全从根本上来说是一个战略信息环境设计的问题,而不是简单的模型对齐问题。
