论文

一种可解释的代理系统,用于通过基于摘要的内存检测会话诈骗

An Explainable Agentic System for Detection of Conversational Scams with Summary-Based Memory

上下文与知识记忆Agent记忆

摘要

随着生成人工智能的快速发展,对话诈骗带来的威胁越来越大。这些诈骗通常持续数周或数月,逐渐建立信任并索要金钱或敏感信息。现有的诈骗检测系统主要关注孤立的消息,这使得它们不足以应对这种不断演变的威胁。本文扩展了单消息网络钓鱼检测,并提出了一种可解释的代理系统,用于检测复杂的会话诈骗。它还推出了 ConScamBench-278,这是一个用于对话式诈骗检测的初始公共多类别基准,涵盖八种诈骗类型,其发布是为了支持可重复的评估和未来的扩展。对于孤立的消息,单消息检测器可实现 100% 的网络钓鱼召回率,而会话级检测器可识别公共 LoveFraud02 语料库 (83/83) 中的所有会话诈骗,并在 ConScamBench-278 上达到 97.8% 的准确率(95% CI [95.4, 99.0])。两项用户研究(N = 100 和 N = 45)进一步激励了该系统:参与者报告在判断可疑对话时经常遇到不确定性。在不受控制的前后比较中,用户自我报告的信任、自信和对基于人工智能的诈骗检测的感知需求均有所增加(p < 0.001,Wilcoxon 符号秩检验)。该系统的系统可用性量表得分为 74.7(95% CI [72.5, 76.9]),高于既定的可用性基准。