论文
PrismAgent:通过零镜头可解释多代理框架阐明模因中的危害
PrismAgent: Illuminating Harm in Memes via a Zero-Shot Interpretable Multi-Agent Framework
摘要
表情包的快速传播使得有害内容检测变得越来越重要,因为有效的识别可以遏制错误信息的传播。然而,现有方法严重依赖大量注释数据,这导致大量的训练成本和有限的泛化能力。为了应对这些挑战,我们提出了 PrismAgent,一个零样本、多代理、可解释的框架。 PrismAgent 将这项任务概念化为刑事案件调查,雇用四名专业代理,负责结构化协作工作流程中的分析、调查、起诉和判决阶段。在第一阶段,分析代理在善意和恶意的假设下解释每个模因,以探究其潜在意图。然后,调查代理从未注释的数据集中检索支持证据,并为模因及其变体构建上下文解释。接下来,检察官代理人通过将原始模因与三种解释中的每一种配对来执行三个独立的初步判断。最后,法官代理人审议所有证据以做出最终裁决。此外,PrismAgent 显式的多阶段推理链使模型本质上是可解释的,因为每个中间步骤都得到显式解释,而不仅仅是产生最终的检测结果。对三个公共数据集的大量实验表明,PrismAgent 显着优于现有的零样本检测方法。