论文

使用几何签名演变和检测多轮欺骗

Evolving and Detecting Multi-Turn Deception using Geometric Signatures

模型评测安全与风险评测

摘要

大语言模型 (LLM) 的安全防御通常在单轮提示上进行训练和评估,但真正的攻击通常以间接、多轮探测的形式展开。为了防御这种更微妙的欺骗形式,我们提出了一个统一的管道,通过与共同进化的突变算子的多目标遗传提示优化来生成真实的多轮欺骗性问题集。我们通过人类研究验证了这个数据集,该研究还揭示了早期世代产生了最令人信服的欺骗和实际约束,例如依从性过滤和排序效应。利用这些数据,我们能够使用嵌入空间中的简单、可解释的几何信号以及轻量级前馈分类器来检测访问禁止信息的欺骗性尝试。三个几何特征(角度覆盖、距离比和线性)通过成对相似性统计增强,形成了一个紧凑的预测模型,该模型在基本、重写和截断(三转)场景中实现了一致的高召回率 (0.89),测试时间 F1 范围为 0.74-0.86。结果支持一个中心假设,即多轮欺骗意图留下稳定的几何足迹,无需昂贵的端到端训练即可实现轻量级、透明的筛查。我们进一步讨论负责任的使用、限制以及通往更大、更多样化的人类评估数据集的路径。对人工智能的主要贡献是即时生成的多目标进化框架,工程应用是为LLM安全基础设施部署轻量级几何检测系统。