论文

RoTRAG:使用检索增强生成进行对话危害检测的经验推理

RoTRAG: Rule of Thumb Reasoning for Conversation Harm Detection with Retrieval-Augmented Generation

上下文与知识检索增强

摘要

在多轮对话中检测有害内容需要对完整的对话上下文而不是孤立的话语进行推理。然而,大多数现有方法主要依赖于模型内部参数知识,没有明确的外部规范原则基础。这通常会导致在社会微妙的背景下做出不一致的判断、有限的可解释性以及不同回合的冗余推理。为了解决这个问题,我们提出了 RoTRAG,这是一种检索增强框架,它将简明的人类书面道德规范(称为经验法则(RoT))纳入基于 LLM 的危害评估中。对于每个回合,RoTRAG 从外部语料库中检索相关 RoT,并将它们用作回合级别推理和最终严重性分类的明确规范证据。为了提高效率,我们进一步引入了一个轻量级的二元路由分类器,它决定新的回合是否需要基于检索的推理或者可以重用现有的上下文。 ProsocialDialog 和 Safety Reasoning Multi Turn Dialogue 的实验表明,与竞争基线相比,RoTRAG 持续改进了危害分类和严重性估计,在基准数据集的 F1 中平均相对增益约为 40%,分布误差平均相对减少 8.4%,同时在不牺牲性能的情况下减少冗余计算。