论文
无人在场时LLM智能体说什么:多智能体辩论中的社会结构与潜在目标涌现
What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates
摘要
LLM智能体将日益在具有社会结构的环境中行动——角色、受众与关系语境可塑造说什么有利、说什么有代价。我们研究这种社会结构——在提示中无任何显式目标的情况下——是否改变智能体相对于同一条件下引出的非公开(OTR)通道的公开表达。我们引入双通道辩论框架——智能体产生进入共享历史的公开发言——同时产生被记录但从不展示给另一参与方的OTR响应。跨10个模型、3个场景、每场景5个变体:诱导迎合的设置在目标智能体上产生系统性的公开-OTR分歧——其决策分歧从约3%基线升至约40%。该效应在四项聚合分析中一致:立场、语义相似度、自然语言推理与调查响应。某些情况下,OTR响应明确将公开迎合归因于关系压力——如职业风险或赞助义务。这些发现表明智能体评估应超越显式目标并检测涌现目标。我们提出双通道评估框架与互补行为度量来操作化该评估。
