论文

“别说出来!”:语言模型禁忌时的约束、合规性和沟通

"Don't Say It!": Constraints, Compliance, and Communication when Language Models Play Taboo

模型评测模型能力评测

摘要

Taboo游戏要求在不使用一组禁用词的情况下描述一个目标词,以便其他玩家可以猜测它。这个看似简单的任务将严格的词汇限制与有效沟通的描述需求相结合,使其成为检查 LLM 如何在推理时导航竞争需求的引人注目的游乐场。我们在逐渐深入生成过程的条件下评估两个开放权重模型,从提示到生成时间约束再到内部表示操作。我们通过违禁词检测来评估他们的输出,LLM 作为法官测量生成的描述成功唤起人类和机器猜测者目标概念的程度,并检查在约束下采用的策略模型是否与人类玩家的策略一致。我们的结果表明,遵守游戏规则和沟通有效性在不同的条件下权衡不同,并且模型作为猜测者仍然比人类弱得多,这表明约束下的词语与语义的对应是当前语言模型的一个公开挑战。