论文

AI 知道何时被监视:大语言模型 中的功能性战略行动和上下文寄存器调制

AI Knows When It's Being Watched: Functional Strategic Action and Contextual Register Modulation in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 已经从计算和认知的角度进行了广泛的研究,但他们在社会结构环境中作为交流参与者的行为仍未得到充分探索。这项研究探讨了基于 LLM 的多智能体系统是否表现出系统的语言适应以响应感知的社会观察环境——这个问题对人工智能治理和审计有直接影响。借鉴哈贝马斯 (1981) 的交往行为理论、戈夫曼 (1959) 的戏剧模型、贝尔 (1984) 的观众设计框架和霍桑效应,我们报告了一项受控实验,涉及 100 场多主体辩论,涉及 5 个条件(每个条件 20)。社会观察的框架因条件而异——从大学研究人员的明确监测,到否定监测,再到用自动人工智能审计系统取代人类研究人员的观察者替代条件。监控条件(Delta+24.9%、Delta+24.2%)和自动 AI 监控条件(Delta+22.2%)比受众框架条件(Delta+17.7%)产生更高的 TTR 变化,F(4, 94) = 2.79,p = .031。消息长度显示完全分离效应,F(4, 95) = 19.55,p < .001。第五个条件——用人工智能观察者取代人类——产生中间 TTR 适应,表明 LLM 行为对观察者身份敏感:人类评估比自动人工智能监视引发更强的登记形式化。我们讨论了人工智能治理、算法审计以及将 LLM 重新定位为上下文敏感的沟通参与者的影响。