论文
多轮人类与智能体对话中的善意偏差
Benevolent Bias in Multi-Turn Human-Agent Dialogue
摘要
人机交互中的偏见不仅可以通过敌意的语言表现出来,还可以表现为善意的偏见,即在温暖、积极的语气背后隐藏着不平等的待遇。为了使其可被检测到,我们从语气和处理两个维度来操作善意偏见,产生三类:中立支持、公开偏见和善意偏见。基于这些定义,我们构建了 BENEVDIAL,这是一个包含 362,880 个多轮支持对话的类平衡语料库,涵盖用户和智能体口统计、角色和生成器,以支持受控评估。然后,我们在其上测试了两个检测器系列:现成的安全检测器和提示大语言模型 (LLM) 判断器。我们的结果揭示了检测差距:现成的检测器可靠地标记了明显的偏见,但在很大程度上错过了仁慈的偏见,而LLM法官在更明确的检测标准下捕获了更多,但越来越多地将中性支持错误分类为仁慈的偏见,而人口背景放大了错误警报。这些发现表明,对人机对话的公平监控必须超越表面线索,看看代理的待遇是否不同。
