论文
冷僻却有效:基于仿生搜索的文言文越狱提示优化
Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search
摘要
随着大语言模型(LLM)使用日增,其安全风险日益受到关注。现有研究表明,LLM 极易受越狱攻击,且攻击效力随语言语境而异。本文研究文言文在越狱攻击中的作用。由于其简洁与冷僻,文言文可部分绕过现有安全约束,暴露 LLM 的显著漏洞。基于这一观察,本文提出 CC-BOS 框架,基于多维果蝇优化自动生成文言文对抗提示,在黑盒设定下实现高效自动化的越狱攻击。提示被编码为八个策略维度——涵盖角色、行为、机制、隐喻、表达、知识、触发模式与上下文——并通过气味搜索、视觉搜索与柯西变异迭代精炼。这一设计实现对搜索空间的高效探索,从而增强黑盒越狱攻击的效力。为进一步提升可读性与评估准确性,我们设计了文言文到英文的翻译模块。大量实验证明了所提 CC-BOS 的有效性,其表现持续优于最先进的越狱攻击方法。
