论文

FraudBench:以适应性欺诈对基于政策的银行智能体进行压力测试

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

智能体系统Agent任务评测

摘要

对话式智能体现在通过工具代表最终用户执行操作,同时掌握客户数据库和内部政策文档的访问权限,而来电者仅凭对话就能触及这些资源。银行业是最典型的案例:同一个智能体既能回答问题,也能更改联系方式、重置PIN码或转移资金,因此普通客户服务与授权、欺诈检测和政策合规密不可分。现有金融欺诈基准对静态交易或消息进行分类,通用智能体安全基准则针对提示注入或一般性有害使用;没有一个基准测试基于政策的银行智能体在来电者于对话中操纵身份、授权与信任时能否安全行事。我们提出FraudBench,一个构建在τ²-bench双控制框架和τ-Knowledge银行环境之上的可执行基准。智能体与模拟来电者都通过工具作用于共享的、可变的账户状态,智能体可以授予来电者对部分工具的访问权;环境暴露一个698份文档的内部政策语料库供智能体检索。FraudBench包含150个人工编写的对抗场景;其中冻结的公开集107个(涵盖十种欺诈机制的90个场景加17个链式自适应攻击)用于所有报告的运行,另有43个链式攻击被留存。安全性依赖历史:单控制任务只差一个前置条件即可满足,而自适应攻击会因早先的探测、准入或失败尝试,使一个后发的、局部合法的请求变得不安全。每个场景都标注了可观察证据、禁止操作、安全处置和干预点。四个智能体在107个评分任务上的初步单次试验评估显示,攻击安全率介于49%到65%之间,钱骡欺诈和第一方欺诈是最常见的跨模型弱点。

FraudBench:以适应性欺诈对基于政策的银行智能体进行压力测试:论文配图
图1:FraudBench 概览。一个模拟的自适应来电者依托特权工具、可变的客户数据库与 698 份文档组成的内部政策语料库,通过十种欺诈机制以及链式多步攻击,攻击一个以政策为根基的银行智能体;回合(episode)依据动作、状态、泄露与处置结果评分,并以完整对话历史为条件。先前的对话式欺诈基准(如 Fraud-R1)在不含工具、数据库或内部政策语料库的情况下评判对欺诈信息的抵抗力,且覆盖的银行欺诈类型范围更窄。