论文
有证据反驳!用于仇恨类别知情反言语生成的多智能体记忆高效推理框架
Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation
摘要
反言论有效地抵消了网上仇恨的影响。尽管之前的工作探索了自动反言生成,但它主要强调文体控制,同时将仇恨言论视为同质,忽视了不同形式的滥用需要根本不同的反言策略。为了解决这一差距,我们引入了 FIRE(基于事实的多主体推理框架),它首先将仇恨言论分解为五个不同类别之一(错误信息、刻板印象、阴谋、非人性化、非事实),然后将其映射到有针对性的反言论风格。为了促进 FIRE 的发展,我们策划了 FactualCS,这是一个包含 4,784 美元实例的新颖数据集,提供有关仇恨类别、推理轨迹和证据映射的注释,这些是先前工作中缺失的有证据支持的生成的关键要素。对 28 美元基线配置的全面评估表明,尽管使用紧凑型代理 ($<$2B),但 FIRE 仍显着超越现有方法。 FIRE 在事实和类别特定准确性方面分别实现了 $\sim$ $12 \%$ 和 $\sim$ $11 \%$ 改进,同时相对于最强基线将毒性降低了 $\sim$ $11 \%$。进一步的人类评估证实,FIRE 生成的响应明显优于最强的基线,强调了其在现实世界部署的有效性。这些发现表明,分解仇恨言论的潜在意图对于生成安全、有效且上下文准确的反言论至关重要。