论文
概念隐写术
Conceptual Steganography
摘要
语言模型 (LM) 发出思想链 (CoT),驱动其大部分功能。然而,携带有用推理的相同序列也可以秘密地传达信息:未对齐的模型可能会在其 CoT 中嵌入隐藏信息,而这些信息会通过人类监督,这是一种称为编码推理的隐写术形式。先前的 LM 隐写术方案在标记或词汇空间中运行,而内容保留释义器是最近工作中规范且有效的防御。我们引入了概念隐写术,其中 CoT 的每一步都通过高级推理行为模式而不是通过词汇选择来携带信息。在四个模型系列和两个推理领域中,这种后门通信渠道对于强大的释义防御来说始终比标准关键字方法更稳健,并且将信息编码到 CoT 中不会影响它们在推理过程中的效用。在提高了对这种新风险的认识后,我们证明了具有策略意识的释义者可以关闭大部分通道,突出新的挑战和建议的防御措施,以确保在野外进行忠实的 LLM 推理。