论文
对齐幻象:协作对话中隐藏分歧的检测
Illusion of Alignment: Detecting Hidden Disagreement in Collaborative Dialogue
摘要
协作对话可能在表面达成一致时结束,而参与者在目标、假设或执行计划上仍存在分歧,形成“对齐幻象”(IoA)。一项覆盖18次会议的真实用户研究证实,IoA在人类协作中经常出现。然而IoA构成一个悖论:如果参与者意识到这些分歧,分歧早已显性化;如果没有意识到,被问到时也无法表达,使IoA对参与者和观察者都不可见。本工作通过生成诊断性选择题使IoA可被检测:参与者之间的答案分歧提供了隐藏分歧的直接行为证据。我们构建IoA-Suite,一个用于检测隐藏分歧的数据集与评估协议,覆盖五类任务和六个领域。我们发现即使是最佳模型也仅达到49.5%的F1,瓶颈被追溯为对话未曾显现的私有上下文。随后我们基于IoA-Suite训练IoA-Prober-8B,在IoA-Suite上达到51.8% F1。在上述18次真实会议中,它每场会议揭示2.89个经参与者确认未曾言明的隐藏分歧,可迁移到真实人类对话。此外,在多Agent协作中,将IoA-Prober-8B与大语言模型智能体配对可提升BigCodeBench-Hard和HiddenBench上的下游任务表现。
