论文

Wiki-Talkie:真实多语言讨论的角色 Agent 基准

Wiki-Talkie: Multilingual Benchmarking of Persona-Based Agents on Real-World Discussions

智能体系统Agent任务评测

摘要

LLM 越来越多地在社交环境中作为自主智能体部署,因此研究它们忠实模拟人类交互的能力至关重要。其核心是将智能体植根于现实的用户角色,但现有数据集依赖于虚构的角色,并且仅限于少数语言,缺乏评估不同人群的行为保真度所需的经验基础。我们引入了 Wiki-Talkie,这是一个来自 Wikipedia Talk 页面的现实世界对话的多语言数据集,涉及跨越两个语系的五种语言:日耳曼语(德语、英语)和罗曼语(西班牙语、法语、意大利语),与源自真实用户社区的角色配对,涵盖社会人口统计属性、自我描述和基于行为的交互特征。使用 Wiki-Talkie,我们评估了跨各种角色调节策略的下一代任务中的智能体交互行为。我们的评估评估智能体是否共同再现了人类讨论中观察到的分布行为模式。结果表明,体现交互行为的用户评论历史始终优于明确的人物角色信息。此外,模型系统性地低估了负面或极端情绪,同时过多地产生了参考和建议,揭示了对宜人性和积极性的偏见。至关重要的是,这些模式在不同语言中都具有很强的适用性,跨语言差异很小。

Wiki-Talkie:真实多语言讨论的角色 Agent 基准:论文原图
图 2:五种调节方法中人类和智能体之间的 ROUGE-L 和重新调整的 BERTScore。左:每种语言模型的平均值。右:每个模型的跨语言平均值。