论文

SPAR-Hate:审计员引导的双语仇恨言论解析多智能体框架

SPAR-Hate: An Auditor-Guided Multi-Agent Framework for Bilingual Hate Speech Parsing

模型推理推理策略与问题分解

摘要

仇恨言论检测近期已从粗粒度分类转向结构化解析,系统必须联合识别仇恨目标、论据和目标级标签。然而,现有研究主要强调基准评估,较少关注结构化仇恨言论解析所涉及的文化、语言和社会群体挑战。为应对这些挑战,我们提出SPAR-Hate,一个审计员引导的双语仇恨言论解析多智能体框架。该框架首先将文档分解为子句级决策单元,然后从受害者、审核者与文化旁观者三个互补视角生成基于证据的判断。一个受证据约束的仲裁过程解决角色特定预测之间的冲突,并将它们聚合为结构化的样本级输出。在STATE-ToxiCN和TBO基准上的实验表明,SPAR-Hate在多样的大语言模型上一致提升双语仇恨解析性能。该框架在双语多元组抽取任务上取得最先进结果,在更严格的结构评估指标下增益最大。

SPAR-Hate:审计员引导的双语仇恨言论解析多智能体框架:论文配图
图2:SPAR-Hate 概览。双语输入被切分为子句级单元,由三个角色条件生成器处理,在证据约束下进行仲裁,并重组为样本级输出。蒸馏利用先前阶段构建教师轨迹用于学生训练。