论文

潜伏:评估 大语言模型 中的战略沟通和信息泄漏

SNEAK: Evaluating Strategic Communication and Information Leakage in Large Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地部署在多代理环境中,其中通信必须平衡信息性和保密性。在此类设置中,代理可能需要向协作者发送信息,同时防止对手推断敏感细节。然而,现有的LLM基准测试主要评估推理、事实知识或指令遵循等能力,并不直接衡量非对称信息下的战略沟通。我们引入了 SNEAK(对抗性知识的秘密感知自然语言评估),这是评估语言模型中选择性信息共享的基准。在 SNEAK 中,模型被赋予语义类别、候选单词集和秘密单词,并且必须生成一条消息来指示对秘密的了解,而不会太清楚地透露它。我们使用两个具有不同信息状态的模拟代理来评估生成的消息:一个盟友,他知道秘密并且必须识别预期的消息,以及一个变色龙,他不知道秘密并试图从消息中推断出它。这产生了两个互补的指标:效用,衡量消息与合作者沟通的程度,以及泄漏,衡量向对手透露了多少信息。使用这个框架,我们分析了现代语言模型中信息性和保密性之间的权衡,并表明不对称信息下的战略通信对于当前系统来说仍然是一个具有挑战性的能力。值得注意的是,人类参与者的表现大幅优于所有评估模型,得分高出四倍。