论文

SDARE-Bench:评估 大语言模型 在二元对话和群体对话中的会话耻辱检测和响应

SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于可能影响社会判断的建议寻求和决策制定。尽管耻辱对人们和社区产生了深远的影响,但基准仍然稀缺。现有的通用领域评估通常依赖于静态提示和固定格式的任务,忽略了日常交流中的对话上下文和受众效果。为了解决这些差距,我们引入了 SDARE-Bench,这是第一个基于场景的基准,评估 LLM 中的污名检测和开放式响应生成,包括 1,138 个二元查询和 1,388 个小组对话。 8 个 LLM 的实证结果一致表明,对耻辱成分的识别很差,尤其是在群体对话中。在开放式反应生成中,群体环境中的耻辱表达明显高于二元环境,对耻辱的抵抗力较弱,建议更不切实际。使用经过 1,392 个人工注释响应训练的分类器对响应进行评估。在构建的群体压力环境中,耻辱表达率进一步增加到惊人的平均 97.5%。我们的研究结果将耻辱反应确定为反复出现的 LLM 安全漏洞,特别是在社交复杂的对话环境中。