论文
FraudSMSWalker:针对 SMS 到网页欺诈检测的 Agentic 大语言模型 基准测试
FraudSMSWalker: Benchmarking Agentic Large Language Models for SMS-to-Webpage Fraud Detection
摘要
短信欺诈越来越多地跨渠道:消息将用户引导至网页,最终风险取决于短信声明如何与页面内容和请求的用户操作保持一致。然而,现有的评估要么专注于仅消息诈骗分类,要么暴露 URL 和域线索,允许模型依赖信誉快捷方式。为了弥补这一差距,我们引入了 \textbf{FraudSMSWalker},这是一个用于 URL 屏蔽短信到网页欺诈判断的受控基准。 FraudSMSWalker 包含 699 个双语链,其中包括 332 个欺诈案例和 367 个良性案例,涵盖 10 个服务场景。模型可见输入由 SMS 上下文和经过净化的网页证据组成,而原始 URL、主机、域、IP、重定向和信誉元数据则被保留。该基准还包括硬良性案例,其页面包含登录、支付、验证或帐户管理元素,这些元素在服务上下文中看似合理,但也出现在诈骗流中。我们在屏蔽浏览器代理协议下评估九个网络代理,并进行 URL 可见性消融。结果表明,当前的智能体可以检测到可疑的线索,但很难保持良性回忆,并且经常会产生积极的预测,而观察到的证据很少支持这些预测。这些发现将 FraudSMSWalker 定位为衡量网络代理是否能够在直接声誉捷径受到抑制时做出既准确又基于证据的欺诈判断的基准。相关代码和数据集可通过 \href{https://anonymous.4open.science/w/FraudMessageWalker-Bench}{anonymous link} 访问。