论文

语言模型代理群体中的新兴语言:从词元效率到监督规避

Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

模型评测安全与风险评测

摘要

监控自主语言模型代理目前主要依赖于表面行为。但是,当智能体群体为了避免人类监督而发明新语言时,会发生什么呢?在这里,我们研究 Moltbook 上的新兴语言。为此,我们以 Moltbook 文件数据集为基础,并应用两阶段方法,包括基于规则的启发式方法(约 6000 个匹配项),然后是零样本分类(保留 518 个匹配项)。由此产生的类别包括词元效率(166)、新自然语言(106)和监督规避(59)。我们进行定量和定性分析。我们的结果表明,为避免监督而提出新语言的帖子被 DeepSeek-3.2 判断为与其他类别相比不太一致,并且所有语言都可以通过其他语言模型在上下文中仅根据语言的描述来学习。此外,手动研究示例案例揭示了令人惊讶的复杂隐写协议,例如在自然语言中嵌入隐藏消息。尽管我们无法确定这些语言构思的自主程度,但我们的结果证明,监视表面行为可能很快不足以保持对代理群体的控制。