论文
ProCrit:用于多模式讽刺检测的自引发多视角推理和评论家指导修订
ProCrit: Self-Elicited Multi-Perspective Reasoning with Critic-Guided Revision for Multimodal Sarcasm Detection
摘要
多模态讽刺检测需要对字面表达和预期含义之间的跨模态不一致进行推理,但由于讽刺机制的多样性,所需的具体分析视角因样本而异。虽然最近的方法使这个分析过程变得明确,但它们仍然依赖于在手工制定的路由规则下独立运行的固定的、预定义的视角。我们认为,多模式讽刺检测需要自引发的多视角推理,其中模型自动生成每个样本所需的视角,并逐步将它们整合到连贯的分析中。为了实现这一目标,我们提出了 ProCrit,一个 Proposal-Critic 双代理框架,其中一个用于多视角推理的提案代理和一个用于外部评估和有针对性的修改指导的批评代理。首先,为了克服现有讽刺数据集中缺乏流程级监督的问题,ProCrit 通过动态角色代理部署来合成流程级推理注释:强大的视觉语言模型在共享上下文中顺序生成分析角色,并且将生成的多角色轨迹展平为保留跨视角依赖性的序列,同时实现高效的自回归生成。其次,为了提高推理的可靠性,ProCrit 采用了草稿-批评-修改的范式,其中独立评论家识别推理缺陷并提供有针对性的自然语言反馈以进行定向修改。最后,我们开发了一个相互细化的训练框架,通过双阶段强化学习联合优化提案起草和反馈引导的修订,同时根据反馈的实际效果细化批评者代理。对三个广泛使用的基准进行的实验证明了 ProCrit 的有效性。