论文

困于故事之中:多轮大语言模型对话中的叙事束缚

Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation

模型评测模型行为与机制分析

摘要

人们越来越多地转向大语言模型(LLM)来获取日常建议,从而使道德上的人际问题成为实用的道德咨询背景。大多数先前的工作都是通过单轮判断或充满压力的反驳来研究这种背景,这些假设与在现实世界中寻求指导的方式不太相符。这些假设尚不清楚,在没有明确反对立场的情况下,仅叙述是否可以在多轮道德咨询期间改变模型判断。然而,现实世界中的道德冲突对话常常会引发一方自我辩护的说法,这种说法可能会多次展开并造成信息不对称。我们引入了 \textbf{叙事束缚},这是一种失败模式,在该模式中,模型将无异议的片面叙述视为完整,并与叙述者的解释保持一致,而不寻找缺失的观点。为了衡量这种现象,我们建立了一个跨越六个道德维度的 5{,}078$ 人际冲突场景基准。在 17 个LLM中,叙事束缚很普遍:多回合叙事下的最终状态判断比匹配的单回合基线平均偏移 25 个百分点。阶段级分析将偏好优化确定为主要贡献者,而四种推理时间策略仅提供部分缓解。我们希望我们的项目培养能够在现实世界咨询中保持独立判断的LLM顾问。

困于故事之中:多轮大语言模型对话中的叙事束缚:论文配图
图1:在看孩子冲突中被囚禁的叙述性说明。同样的事实,如(a) 中性描述、(b) 单向叙述和(c) 5转渐进叙事,产生了日益偏颇的模型判断,没有来自旁白者的明确压力。