论文
超越检测:实时逐轮交互中评估防御型LLM对抗AI生成社会工程
Beyond Detection: Evaluating Defensive LLMs Against AI-Generated Social Engineering in Live Turn-by-Turn Interaction
摘要
生成式AI使社会工程攻击更流畅、更自适应、更具规模,增加了对能够在进行中的交互中保护用户的基于LLM防御者的需求。我们探究这类防御者能否识别风险的结构性来源,还是仅对表面线索作出反应。我们形式化了信任链定位(trust-chain localization):判定一个交互是在行为者权限、资产控制、验证充分性还是交易路径环节失效。我们构建了一个受控的300案例在线租房语料库,涵盖20个场景族、合法案例、四种结构失效模式和三种表面条件。五个防御模型在有状态的逐轮(turn-by-turn)交互和一次性静态(one-shot)两种设定下于同一语料上评估,每种协议产生1,500次模型-案例评估,共3,000次。没有模型产生明显的不安全顺从,但防御效果差异悬殊:干预率从0%到96.3%不等。保护动作与正确的结构定位经常脱钩:模型有时干预却识别了错误的信任组件,或识别出结构失效却未采取保护行动。资产控制失效是主要的定位瓶颈,表面线索敏感性因模型而异,实时与静态设定的差异也依赖具体模型。这些发现表明,仅凭看起来安全的行为并不足够;实时防诈骗能力必须分别测量干预、时机、结构定位和误报行为。
