论文

越过机器说话:人类与人工智能对话中的道德、礼貌和一致性

Talking Past the Machine: Morality, Politeness, and Alignment in Human-AI Dialogue

模型评测模型行为与机制分析

摘要

对话式人工智能系统可以产生流畅的、适合社交的反应,但它们是否参与协作通信或仅仅模拟其表面形式仍不清楚——这是如何评估、信任和设计这些系统的核心问题。这项研究调查了与人与人对话相比,道德、礼貌和一致性(合作对话的三个核心维度)在人与人工智能交互中的作用。我们分析了 15,881 个人与 ChatGPT 和 10,784 个人与人的多回合对话,使用混合效果模型来识别哪些特征可以预测回合到回合的对齐。我们观察到一种一致的分离:人工智能产生了合作沟通的表面特征,而没有底层的社会架构。道德输出似乎是预先配置好的,而不是经过协商的;产生温暖,无需面部敏感;语言趋同性持续下降。最引人注目的是,合作机制本身逆转了方向:与人类之间更大的包容性相关的对冲和软化与人工智能产生时的一致性减少相关,而与人类分歧相关的纯度框架与用户向人工智能的聚合相一致。代理——为用户提供塑造交流的空间——是两种交互类型中一致的最一致的预测因素,而在最近的模型中较低的道德自信并没有伴随着更好的合作。这些模式共同表明,人工智能在没有人类之间相互适应的情况下再现了合作的表面——更令人惊讶的是,维持人类适应的机制可以与人工智能相反,这表明轮回层面的观点可能不足以实现互动层面的成功。