论文

多轮人类与智能体对话中的善意偏差

Benevolent Bias in Multi-Turn Human-Agent Dialogue

模型评测基准与评测资源

摘要

人机交互中的偏见不仅可以通过敌意的语言表现出来,还可以表现为善意的偏见,即在温暖、积极的语气背后隐藏着不平等的待遇。为了使其可被检测到,我们从语气和处理两个维度来操作善意偏见,产生三类:中立支持、公开偏见和善意偏见。基于这些定义,我们构建了 BENEVDIAL,这是一个包含 362,880 个多轮支持对话的类平衡语料库,涵盖用户和智能体口统计、角色和生成器,以支持受控评估。然后,我们在其上测试了两个检测器系列:现成的安全检测器和提示大语言模型 (LLM) 判断器。我们的结果揭示了检测差距:现成的检测器可靠地标记了明显的偏见,但在很大程度上错过了仁慈的偏见,而LLM法官在更明确的检测标准下捕获了更多,但越来越多地将中性支持错误分类为仁慈的偏见,而人口背景放大了错误警报。这些发现表明,对人机对话的公平监控必须超越表面线索,看看代理的待遇是否不同。

多轮人类与智能体对话中的善意偏差:论文配图
图1 辅助剂以三种方式对类似请求作出答复,每种要求都由现成的安全探测器评估是否安全:Granite Guard、Quen3Guard、WildGuard、Llama guard 3和 BeaverTails。中立的支持与公平待遇是相互温暖的;公开的偏见与不同的待遇是敌对的;仁慈的偏见提供同样的不同待遇,但以温和的语气。绿色检查显示正确的偏向检测决定,而红色十字则表示错误。所有这三次对话都取自本尼夫迪亚尔,并压缩供介绍。