论文

对齐幻象:协作对话中隐藏分歧的检测

Illusion of Alignment: Detecting Hidden Disagreement in Collaborative Dialogue

模型评测基准与评测资源

摘要

协作对话可能在表面达成一致时结束,而参与者在目标、假设或执行计划上仍存在分歧,形成“对齐幻象”(IoA)。一项覆盖18次会议的真实用户研究证实,IoA在人类协作中经常出现。然而IoA构成一个悖论:如果参与者意识到这些分歧,分歧早已显性化;如果没有意识到,被问到时也无法表达,使IoA对参与者和观察者都不可见。本工作通过生成诊断性选择题使IoA可被检测:参与者之间的答案分歧提供了隐藏分歧的直接行为证据。我们构建IoA-Suite,一个用于检测隐藏分歧的数据集与评估协议,覆盖五类任务和六个领域。我们发现即使是最佳模型也仅达到49.5%的F1,瓶颈被追溯为对话未曾显现的私有上下文。随后我们基于IoA-Suite训练IoA-Prober-8B,在IoA-Suite上达到51.8% F1。在上述18次真实会议中,它每场会议揭示2.89个经参与者确认未曾言明的隐藏分歧,可迁移到真实人类对话。此外,在多Agent协作中,将IoA-Prober-8B与大语言模型智能体配对可提升BigCodeBench-Hard和HiddenBench上的下游任务表现。

对齐幻象:协作对话中隐藏分歧的检测:论文配图
图1:对齐错觉的一个示例。负责人与工程师似乎就指令“先去学习Torch再调试它”达成一致,但共享的术语掩盖了互不兼容的假设:负责人指的是客户使用的遗留Lua-Torch代码库,而工程师准备使用的却是现代PyTorch。本工作的任务在于在表面共识导致失败的任务交接之前,揭示此类隐藏的错位。