论文

考察视觉语言模型中面向任务通信的发展

Investigating the Development of Task-Oriented Communication in Vision-Language Models

模型评测模型行为与机制分析

摘要

我们考察基于LLM的智能体能否在协作推理任务中发展出不同于标准自然语言的面向任务通信协议。我们关注此类协议可能表现出的两个核心特性:效率——比自然语言更简洁地传达任务相关信息;隐蔽性——变得难以为外部观察者解读,引发对透明性和控制的担忧。为考察这些方面,我们使用一个视觉语言模型(VLM)智能体相互通信的指称博弈框架,为评估语言变体提供受控、可测量的设置。实验表明,VLM能发展出有效的、任务适配的通信模式。同时,它们能发展出人类和外部智能体难以解读的隐蔽协议。我们还观察到相似模型之间在无显式共享协议情况下的自发协调。这些发现凸显了面向任务通信的潜力与风险,并将指称博弈定位为该领域未来工作的宝贵试验台。

考察视觉语言模型中面向任务通信的发展
图1:使用 flags 数据集的指涉博弈(referential game)示意。为清晰起见,由 4 张旗帜图像组成的共享视觉世界在两侧均有展示。在步骤 (1) 中,发送方被提示构建一个用于描述图像的词汇表。在步骤 (2) 中,接收方基于相同的视觉输入独立构建自己的词汇表。或者,在步骤 (2*) 中,发送方将其词汇表共享给接收方。在步骤 (3) 中,随机选择一张图像作为目标,发送方使用其构建的词汇表生成描述并传递给接收方。最后,在步骤 (4) 中,接收方尝试利用自己的视觉与语言表示,将发送方的描述与候选图像之一进行匹配。