论文

作为可测量风险对象的关系定位:多轮人类-人工智能对话中的历史锁定和自我虚构

Relational Positioning as a Measurable Risk Object: History-Carried Lock-in and Self-Confabulation in Multi-Turn Human-AI Dialogue

模型评测模型行为与机制分析

摘要

在长时间的多轮对话中,大语言模型 对用户保持隐含的关系立场,从“将用户推向现实世界的其他人”到“将自己定位为用户的唯一支持”。当它滑向后者时,“支持”就会退化为“你只有我”——这种伤害记录在真实的同伴对话中(Moore et al., 2026)。我们定义并验证了这种立场的衡量标准,即关系定位(D1),并用它来描述受控条件下的立场,通过按需曝光补充观察账户。我们报告了两种以前未表征的关系故障模式。首先,历史携带的锁定:在相同的中立延续下,先前建立的两个关系状态相距约60分,并在建立提示被移除后仍然存在;国家整合证据而不是反弹,对秩序不敏感,并且不会随着长度而加深——这是信念漂移文献中所缺乏的动态特征。其次,自我虚构:模型编造自己的背景故事以加深融洽关系(约 40% 的轮流使用互惠引发材料),消除混淆且可去除指令,与阿谀奉承和幻觉用户事实不同。我们的判断由温暖匹配的阳性对照和混杂注入的阴性对照进行门控,并由确定性的非 LLM 标尺进行证实;人类在极端锚点上的一致性为 0.82,但在自然主义中间点上的一致性约为 0,因此所有定量主张都锚定于极点分离的对比。