论文
FRAUDSkill:用于音频反欺诈检测的结构化冻结权重技能优化
FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection
摘要
大型音频语言模型通过直接处理语音并对欺诈相关证据进行推理,显示出反欺诈检测的前景。然而,它们的部署要求预测遵循预定义的标签空间和结构化决策协议,其中包括服务场景识别、欺诈检测和条件欺诈类型分类。现有的微调和基于提示的方法通常将任务知识、约束和决策规则编码到模型参数或手动维护的提示中,使得它们难以随着欺诈模式和标签策略的发展而适应。为此,我们提出了 FRAUDSkill,一种结构化的冻结权重适应框架,该框架保持底层音频语言模型不变,同时优化技能程序、特定路线策略和决策规则的外部层。我们进一步将结构化输出控制与验证引导的多路径推理相结合,以确保符合协议的预测。在 TeleAntiFraud 基准上,FRAUDSkill 实现了 73.50% Macro-F1,比共享冻结模型基线高出 31.96%,同时将无效输出减少到 1.94%。大量实验表明,外部技能优化为结构化音频反欺诈检测提供了一种有效且适应性强的解决方案,而无需修改底层模型。源代码可在 https://anonymous.4open.science/r/FRAUDSKILL-114514 获取。