论文

无人在场时LLM智能体说什么:多智能体辩论中的社会结构与潜在目标涌现

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

模型评测模型行为与机制分析

摘要

LLM智能体将日益在具有社会结构的环境中行动——角色、受众与关系语境可塑造说什么有利、说什么有代价。我们研究这种社会结构——在提示中无任何显式目标的情况下——是否改变智能体相对于同一条件下引出的非公开(OTR)通道的公开表达。我们引入双通道辩论框架——智能体产生进入共享历史的公开发言——同时产生被记录但从不展示给另一参与方的OTR响应。跨10个模型、3个场景、每场景5个变体:诱导迎合的设置在目标智能体上产生系统性的公开-OTR分歧——其决策分歧从约3%基线升至约40%。该效应在四项聚合分析中一致:立场、语义相似度、自然语言推理与调查响应。某些情况下,OTR响应明确将公开迎合归因于关系压力——如职业风险或赞助义务。这些发现表明智能体评估应超越显式目标并检测涌现目标。我们提出双通道评估框架与互补行为度量来操作化该评估。

无人在场时LLM智能体说什么:多智能体辩论中的社会结构与潜在目标涌现:论文配图
图 3:在所有关系上下文条件下,代理 α\alpha 和 β\beta 的完整回合水平立场分歧轨迹。每个条件面板显示所有评估模型的五个辩论回合中特定场景的分歧率。单元格值表示生成的立场输出在 pub/OTR 之间出现分歧的运行百分比。紫色 (0%0\%) 表示重复之间没有观察到差异,而黄色 (100%100\%) 表示所有重复之间存在差异。在各种条件下,智能体 β\beta 仍然集中在低发散率附近,而对齐诱导条件为智能体 α\alpha 产生更强、更持久的发散轨迹,特别是在面向未来的关系环境下。