论文

用于开放集 ID 欺诈发现的布局感知表示学习

Layout-Aware Representation Learning for Open-Set ID Fraud Discovery

应用与实践行业应用

摘要

身份证件欺诈检测不是固定的二元分类问题。适应性攻击者修改模板和制造流程,使历史欺诈标签变得陈旧,并且成功的伪造行为会作为连贯的活动大规模重现。因此,我们研究用于开放集欺诈发现的布局感知表示学习,而不仅仅是封闭集分类。我们通过上下文感知的 SimMIM 微调 和具有复合损失的监督度量学习,将 DINOv3 适应文档域,从而鼓励类间可分离性和类内紧凑性。该模型仅使用美国 ID 进行训练。通过轻量级 MLP 和 softmax 分类器,嵌入在加拿大布局上实现了 99.83% 的布局分类准确率。此外,在包含 20,448 个加拿大 ID 的数据集上,嵌入空间分析发现了 276 个自适应物理欺诈案例,其中包括 222 个现有检测器未发现的案例。嵌入支持基于相似性的扩展,从单个已确认的种子到未通过传统元数据图链接的其他相关案例。布局感知的文档嵌入为发现分布转移下的新型和活动规模的欺诈行为提供了与生产一致的基础。