论文

表面之下:研究 LLM 与潜台词通信的功能

Beneath the Surface: Investigating LLMs' Capabilities for Communicating with Subtext

模型评测模型能力评测

摘要

人类交流从根本上来说是创造性的,并且经常利用潜台词——超越文本字面内容的隐含意义。在这里,我们系统地研究语言模型是否可以在交际环境中使用潜文本,并引入四个新的评估套件来评估这些能力。我们的评估设置范围从编写和解释寓言到玩受 Dixit 等棋盘游戏规则启发的多智能体和多模式游戏。我们发现前沿模型通常对过于字面、明确的沟通表现出强烈的偏见,因此无法考虑到细微差别的约束——即使是表现最好的模型在我们的环境之一——视觉暗示中也有 60% 的时间生成字面线索。然而,我们发现有些模型有时可以利用与另一方的共同点来帮助他们进行潜台词交流,从而减少过于字面的线索30%-50%;但如果没有明确说明,他们很难推断出存在共同点。对于寓言理解,我们发现副文本和角色条件可以显着改变潜文本的解释。总的来说,我们的工作为潜台词等本质上复杂且主观的现象提供了可量化的衡量标准,并揭示了当前 LLM 的许多弱点和特质。我们希望这项研究能够激发未来基于社会的创造性沟通和推理的工作。