论文
仅供您参考:评估孤立语言模型实例之间的协调性
For Your Eyes Only: Evaluating Coordination Between Isolated Language Model Instances
摘要
随着自动化工作流程中的其他模型实例越来越多地使用模型生成的内容,出现了一个实际重要的问题:模型是否可以在自然语言中嵌入同一模型的独立实例可以检测到的信号,仅依赖于共享的预训练和任务指令,而不需要任何共享内存或特定于协调的训练?我们推出了 For Your Eyes Only,这是一款旨在直接评估这一点的合作信号游戏。发送者为两个单词生成自由格式的描述,其中一个是隐藏目标;孤立的接收者必须识别它。我们使用双通成功率来控制输出偏差,对来自已建立的心理语言学语料库的 300 个单词对评估了来自四个建筑家族的七个当代模型。我们发现,大多数模型一旦需要避免可检测到的信号,就很难保持协调,而一种前沿模型即使在这种过滤之后仍能保持近乎完美的性能。我们进一步表明,模型可以将这种能力导向故意的误导,并且架构之间的协调始终比架构内部的协调弱。