论文

BenSyc:在 LLM 中针对孟加拉语环境对会话阿谀奉承和人类对齐进行基准测试

BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地参与情感敏感的社交对话,其中反应可能从平衡支持转向过度验证或升级调整。现有的阿谀奉承研究主要集中在事实一致和遵循指令的环境上,而对基于文化的对话式阿谀奉承的探索还不够。我们介绍 BenSyc,这是研究孟加拉社会环境中会话阿谀奉承的第一个基准。从孟加拉国和西孟加拉邦社区收集的 11,840 个 Reddit 帖子和 17 万条评论开始,我们构建了一个经过人工验证的基准,其中包含二进制标签和涵盖失效、中立、支持、验证和升级的细粒度五级分类法。我们在对话对齐分类和响应生成任务上评估了超过 15 个开放和专有的 LLM。结果表明,即使对于前沿指令调整模型来说,区分移情支持和强化验证仍然具有挑战性:最好的系统在二元检测上仅达到 61.8 Macro-F1,在五类分类上仅达到 61.7 Macro-F1。在一代人的环境中,一些模型经常在情绪激动的情况下产生强烈的验证或升级反应。我们的研究结果强调了模型家族和对话行为之间的巨大差异,强调了基于文化的多语言基准对于评估社会一致的对话人工智能系统的重要性。