论文

TeleAntiFraud 2.0:可刷新、基于配置文件且基于音频的电信欺诈检测基准

TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection

模型评测基准与评测资源

摘要

电信欺诈脚本发展迅速,通常被设计为类似于日常服务对话,为基于音频的电信欺诈评估提出了两个关键要求。首先,基准测试必须纳入新观察到的诈骗模式,而不会覆盖以前建立的测试集。其次,他们必须区分欺诈和合法的近域调用,而不是依赖于主题分离的负面示例。我们推出 TeleAntiFraud 2.0,它是用我们的混合树反欺诈生成管道构建的,并根据每月冻结的评估协议进行评估。该管道将​​在线欺诈案例摘要转换为基于配置文件的场景,通过混合树生成对其进行扩展,在共享上下文下实现欺诈和非欺诈对话路径,将经过验证的对话呈现为角色匹配的语音,并冻结每个月评估集的结果音频、标签、提示、清单和出处记录。每个冻结集包含 900 个中国呼叫,其中包括 600 个欺诈案例和 300 个近域非欺诈案例。受控文本实验表明,当针对不相关或普通负片进行评估时,三个分类器实现了完美的宏平均 F1 (Macro-F1),但对于近域同级负片则下降至 0.65-0.68。全套音频和自动语音识别加上大语言模型 (ASR+LLM) 评估进一步揭示了类先验捷径、预测崩溃和快照敏感性。总之,这些发现将近域构建和崩溃感知报告确立为在现实混乱条件下评估基于音频的电信欺诈模型的核心要求。随附的研究工件包括构建代码、评估脚本、清单和文档。我们的数据集和代码可在 https://anonymous.4open.science/r/TeleAntiFraud-2_0-EEB2/ 上获取。