论文
用于有效反叙事生成和完善的多阶段代理框架
A Multi-Stage Agentic Framework for Effective Counter-Narrative Generation and Refinement
摘要
仇恨言论和错误信息在社交网络上的迅速传播对民主社会构成了挑战,因为直接镇压可能会加深两极分化,加剧公众的不信任,并强化极端主义叙事。大语言模型驱动的反叙事(CN)提供了一种降低这些风险的有希望的方法,但其有效性取决于人们对修辞和文体的选择,而人们对这些选择仍然知之甚少。我们提出了一个基于多阶段代理的框架,用于生成、完善和评估 CN,适用于与乌克兰战争有关的亲俄仇恨和错误信息叙述,并适用于其他领域。与人类评估者进行的试点实验确定了有效的技术风格配对,例如重复与情感框架增强说服力。基于这些见解,我们引入了一个多智能体细化过程,可以迭代地改进 CN 的说服力、情感参与度和可共享性。在人工验证确认改进后,自动安全分析表明,我们改进的 CN 与专家撰写的反驳言论相匹配或有所改进。然后,模拟实验表明,它们降低了亲俄罗斯叙事的感知强度,并始终优于普通的大语言模型基线,突出了针对仇恨言论和错误信息的可扩展的、针对特定叙事的干预措施的途径。这项工作附带的代码和数据可在 https://github.com/carmelkron/inlg2026-counter-narratives 上公开获取。