论文
ThinkDeception:可解释多模态欺骗检测的渐进强化学习框架
ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection
摘要
多模态欺骗检测对识别欺诈意图至关重要——但既有方法主要依赖端到端黑箱范式。这些方法严重缺乏可解释性——无法提供透明推理轨迹——且难以显式捕捉欺骗行为固有的微妙跨模态不一致。为超越这些局限——我们提出ThinkDeception——新颖可解释的多模态欺骗检测框架。作为开创性努力——它把多模态大语言模型(MLLM)引入该领域——把欺骗检测从传统二分类任务转为显式认知推理过程。借助首个精心标注的逐步多模态思维链(CoT)数据集——我们开发基础模型ThinkDeception Base——实证验证模态不一致在解码欺骗中的关键作用。在此基础上的核心创新是提出带渐进训练策略的视觉-音频一致性组相对策略优化(VAC-GRPO)。有别于标准GRPO——我们把训练数据分层为四个渐进难度层——引导模型完成有心理学依据的由易到难认知过渡。通过把动态课程调度器与多维、过程感知奖励机制及反思学习范式创新耦合——我们显著提升模型整体推理质量。主流基准上的大量实验表明ThinkDeception创下新SOTA——在检测准确率与理据质量上都显著超越既有方法。本工作最终成功推动欺骗检测领域走向可解释的多模态认知推理。
