论文

ICO:通过迭代上下文优化增强语义转换越狱

ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization

上下文与知识上下文工程

摘要

基础模型在各种任务中取得了显着的成功,但它们仍然很脆弱。为了研究此类漏洞,语义转换越狱最近已成为一种有前途的攻击范例。他们通过用良性替代项替换原始有害问题中的有害术语,并利用上下文信息诱导目标模型将这些替代项重新解释为其相应的有害概念,从而绕过显式安全机制。然而,现有的语义转换越狱通常效果有限。在这项工作中,我们揭示了这种限制是由于忽视上下文的语义转换能力而产生的。通过系统分析,我们发现上下文在诱导语义转换方面表现出截然不同的能力:语义转换能力较强的上下文更有可能引导模型恢复有害含义并成功越狱。基于这一发现,我们系统地识别和提炼了有效上下文的特征,并提出了一种具有迭代上下文优化(ICO)的黑盒上下文感知语义转移越狱框架。在每次迭代中,ICO 利用这些特征和目标模型的反馈来优化环境。对三个数据集和八个目标基础模型的广泛实验表明,ICO 始终优于八个最先进的基线,平均攻击​​成功率为 74.6%。