论文
超越静态基准:通过基于角色的模拟合成有害内容以进行稳健评估
Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation
摘要
有害内容检测的静态基准在可扩展性和多样性方面面临限制,并且还可能受到网络规模 预训练 语料库污染的影响。为了解决这些问题,我们提出了一个利用角色引导的 大语言模型 (LLM) 代理来合成有害内容的框架。我们的方法通过将人口特征和主题兴趣与情境有害策略相结合来构建二维用户角色,从而能够模拟多样化且基于上下文的有害交互。我们从三个维度评估该框架:危害性、挑战程度和多样性。人类和基于 LLM 的评估都证实我们的框架实现了很高的有害生成成功率。跨多个检测系统的实验表明,我们的合成场景比现有基准测试中的场景更具挑战性。此外,多方面的分析证实,我们的方法实现了与人类管理的数据集相当的语言和主题多样性,从而使我们的框架成为对有害内容检测系统进行稳健压力测试的有效工具。