论文
注入悖论:通过 RAG 上下文注入对经过安全训练的 LLM 建议进行品牌级抑制
The Injection Paradox: Brand-Level Suppression in Safety-Trained LLM Recommendations via RAG Context Injection
摘要
我们在基于 RAG 的 LLM 推荐中提出了一种可重现的安全训练失败模式,即注入悖论,其中嵌入在检索到的文档中的即时注入对攻击者适得其反,将目标品牌抑制在无注入基线以下。在经过安全训练的 Claude 模型中,包含即时注入的文档的推荐率急剧下降,并且这种抑制会从注入的文档传播到同一品牌的未修改文档。在 Claude Opus 4.6 中,目标品牌在所有 50 次试验中从 54% 基线下降到零前 2 名推荐,即使语料库中只有 4 个品牌文档中只有 1 个包含注入。这种方向模式在三个品牌的反事实实验中得到了重现。测试的 GPT 模型的对比结果(其中相同的注入反而增加了推荐)表明模型系列在类似注入的上下文如何影响推荐行为方面存在差异。这些发现提出了反向攻击场景的技术可能性,其中对手在竞争对手的文档中嵌入注入,通过安全敏感的模型行为压制竞争对手的品牌。代码、提示、隐私保护的每次试验结果记录和汇总结果都会被发布。