论文

场景级分布转移下的证据一致生成检测

Evidence-Consistent Generative Detection under Scenario-Level Distribution Shift

模型训练监督微调与指令调优

摘要

当训练和测试数据共享重复出现的特定于任务的模式或表面线索时,传统的分布内评估可能会高估鲁棒性。这种风险在社会工程欺诈检测中尤其重要,攻击者可以在改变场景、模拟实体或措辞的同时保留恶意意图。我们将此问题研究为短信和语音网络钓鱼的场景级分布外(SL-OOD)检测,其中整个攻击场景都在训练中被保留,而标签空间保持固定。此设置测试模型是否可以使用与决策相关的证据而不是熟悉的特定场景线索泛化到未见过的攻击场景。使用此 SL-OOD 评估,我们发现高分布内性能并不能可靠地预测基于特征、编码器和解码器的基线的保持鲁棒性。我们将这种差距解释为场景记忆:依赖于重复出现的特定于场景的词汇或实体线索,而不是与决策相关的证据。我们提出了 ECoG,一种证据一致的生成框架,它将证据跨度监督与训练期间的理由标签一致性目标结合起来。在 0.5B 解码器上,相对于未经一致性正则化训练的相同主干网,ECoG 将 OOD 挑战性实例上的 Macro-F1 提高了 3.22 个点,将生成的基本原理支持相反标签的预测份额减少了 4.22 个点,并将 词元级 与参考证据跨度的重叠增加了 8.38 个点;预测原理不一致的减少在四个解码器主干中是一致的。这些结果表明,紧凑的生成检测器可以受益于社会工程转变下的证据监督和基本原理标签一致性。