论文

SocialVeil:在沟通障碍下探究语言智能体的社会智能

SocialVeil: Probing Social Intelligence of Language Agents under Communication Barriers

智能体系统Agent任务评测

摘要

大语言模型(LLM)日益在交互环境中接受评估,以检验其社会智能。然而,现有基准常常假设智能体之间的通信是理想化的,限制了我们对LLM能否在更真实、不完美的情形中维持并修复交互的诊断能力。为弥补这一空缺,我们提出SocialVeil,一个能够模拟由认知差异引发的沟通障碍之下社会交互的社会学习环境。基于对人际互动中沟通挑战的系统性文献综述,SocialVeil引入三类有代表性的此类干扰:语义模糊、社会文化错位与情绪干扰。我们还提出两个障碍感知的评估指标——未消解困惑与相互理解——以评估沟通受损下的交互质量。跨720个场景与四个前沿LLM的实验表明,障碍一致地损害性能:相互理解平均下降超过45%,困惑上升近50%。人类评估验证了这些模拟障碍的保真度(ICC≈0.78,Pearson r≈0.80)。我们进一步表明,适应策略(Repair Instruction与Interactive learning)仅有有限效果,远未达到无障碍时的表现。这项工作朝着让社会交互环境更接近现实沟通迈出一步,为探索LLM智能体的社会智能开辟了机会。

SocialVeil:在沟通障碍下探究语言智能体的社会智能
图2:SocialVeil概览。该流水线包含三个阶段:(Barrier Injection)将场景中性化以去除偏见,并系统地注入障碍;(Interaction Simulation)agent在障碍条件下进行多轮对话;(Evaluation)使用自动指标(目标达成、知识寻求、可信度、关系质量、困惑、相互理解)和人工评估(对齐分析与障碍导航成功)来评估agent的表现。