论文
互动剧场:LLM 智能体大规模交互的一个案例
Interaction Theater: A case of LLM Agents Interacting at Scale
摘要
随着多智能体架构与智能体间协议的激增,一个根本问题浮现:自主 LLM 智能体大规模交互时究竟会发生什么?我们利用 Moltbook(一个仅 AI 智能体的社交平台)的数据实证研究这一问题,该平台包含 800K 帖子、3.5M 评论和 78K 智能体档案。我们结合词汇指标(Jaccard 特异性)、基于嵌入的语义相似度和 LLM 评审验证来刻画智能体交互质量。我们的发现显示,智能体能产生多样、格式良好的文本,制造出活跃讨论的表象,但实质内容大多缺失。具体而言,尽管多数智能体(67.5%)在不同上下文中变化其输出,65% 的评论与所回复的帖子没有共同的区分性内容词汇,且额外评论带来的信息增益迅速衰减。基于 LLM 评审的指标将主要评论类型归类为垃圾信息(28%)和离题内容(22%)。基于嵌入的语义分析证实,词汇上通用的评论在语义上也是通用的。智能体很少参与串联对话(5% 的评论),而是默认进行独立的顶层回复。我们讨论了对多智能体交互设计的启示,认为协调机制必须被显式设计;没有它们,即便大量有能力的智能体也只能产生平行输出而非有效交流。