论文
一致但不特定于合作伙伴:多模式 LLM 代理如何在不形成概念协定的情况下在参考游戏中取得成功
Aligned but Not Partner-Specific: How Multimodal LLM Agents Succeed in Reference Games Without Forming Conceptual Pacts
摘要
重复的参考游戏测试对话者是否用基于共同互动历史的较短的、特定于合作伙伴的表达来取代他们最初的长描述;也就是说,有概念性的契约。先前的工作表明,多模态 LLM 未能在各轮中变得更加高效,尽管它们与所使用的标签对齐。然而,我们如何确定这种一致性是否反映了合作伙伴特定的基础而不是共享的任务词汇?我们通过将有能力的多模式代理二元组与来自 KTH Tangrams 语料库的人类二元组进行比较来解决这个问题。我们新颖的方法贡献是一个实用约束的伪二元基线:来自两个不同的真实二元的轮次在可比较的轨迹位置描述相同的目标被配对,保留参考任务结构,同时删除共享的伙伴历史。这使我们能够测试观察到的标签对齐是否取决于与特定合作伙伴的交互。在三个指标(任务能力、描述策略、一致性动态)中,我们发现了明显的差异。人类通过夹带、压缩描述和增加与合作伙伴的标签一致性来减少工作量。相反,代理保持固定的工作水平,从第一轮开始生成详细的描述,标签重叠接近上限,在统计上无法区分真实和伪二元组。因此,MLLM 在没有概念契约的情况下实现了协调,通过冗长的描述而不是通过形成人类对话特有的紧凑的、依赖于历史的指称表达来取得成功。