论文

Metis:通过自我进化元认知策略优化学习越狱 LLM

Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

模型评测安全与风险评测

摘要

红队对于发现 大语言模型 (LLM) 中的漏洞至关重要。虽然自动化方法提高了可扩展性,但现有方法通常依赖于静态启发式或随机搜索,这使得它们对于高级安全对齐来说很脆弱。为了解决这个问题,我们引入了 Metis,这是一个框架,它将越狱重新表述为对抗性部分可观察马尔可夫决策过程(POMDP)中的推理时间策略优化。 Metis 采用自我进化的元认知循环来对目标的防御逻辑进行因果诊断,并利用结构化反馈作为语义梯度来完善其策略,通过透明的推理轨迹提供增强的可解释性。对 10 个不同模型的广泛评估表明,Metis 在比较方法中实现了最强的平均攻击成功率 (ASR),达到 89.2%,在弹性前沿模型上保持高效(例如,O1 为 76.0%,GPT-5-chat 为 78.0%),而传统基线表现出显着的性能下降。通过用定向优化取代冗余探索,Metis 将词元成本平均降低了 8.2 倍,最高可达 11.4 倍。我们的分析表明,当前的防御措施仍然容易受到测试设置下内部引导的闭环推理轨迹的影响,这凸显了对能够在推理过程中动态推理安全性的下一代防御措施的迫切需求。