论文
SR-Fraud:用于非固定支付欺诈检测的结果监督反思大语言模型代理框架
SR-Fraud: An Outcome-Supervised Reflective LLM Agent Framework for Non-Stationary Payment Fraud Detection
摘要
实时支付欺诈检测是一个非平稳流预测问题:对手在监督标签成熟之前进行适应,局部突发攻击可能会在重新训练之前造成损失。生产系统通常依赖于表格分类器和规则,在定期重新训练发生之前可能很难捕获这些新兴的顺序模式。我们提出了 SR-Fraud,这是一个结果监督的反思性 LLM 框架,它将请求时决策与离线适应分离。冻结的无状态代理对混合情景窗口中的每笔交易进行评分,以跟踪行为变化,而离线反思代理则根据成熟的错误提出边界假设。然后,确定性验证者只承认支持的假设进入可执行的知识状态。在生产支付欺诈基准上,SR-Fraud 改进了其冻结决策代理的所有检测指标,获得比静态和定期重新训练的 CatBoost 更高的点估计,并检测新出现的欺诈爆发。