论文
跨会话分解攻击:规模扩展风险与意图对齐检索防御
Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense
摘要
缩放定律通常被解读为一个能力故事:较低的语言建模损失会产生更有用的模型。我们在\emph{跨会话分解攻击}中研究了这种机制的安全后果,其中在独立的交互中询问看似良性的子查询,然后针对禁止的目标进行重组。我们将这种设置形式化为\emph{组合安全风险},并证明一个条件风险转移界限:当参考环境已经包含风险重建的分散证据时,部署的组合风险和参考组合风险之间的差距由模型在允许的子查询上的超额损失来控制。综合扣留实验表明,更宽的Transformer将更低的损耗分配给保留的指令,这些指令在训练中不会逐字出现,但可以从注入的支持事实中恢复。 600 项预训练 LLM 评估表明,较大的 Qwen3 和 Gemma3 家族成员可以在固定的分解组合管道下产生更大的有害能力提升。作为一种防御,我们的 22M 参数意图对齐检索器 IntentAlign-MiniLM 在保留意图检索方面优于更大的嵌入模型,并在经过测试的护栏上产生最佳学习检索器有害召回。代码可在 \href{https://github.com/liaodisen/Cross-Session-Decomposition-Attacks}{我们的 GitHub 存储库}中找到。
