论文
学习隐写术很容易,学习隐写推理很难
Learning Steganography Is Easy, Learning Steganographic Reasoning Is Hard
摘要
思维链监控作为人工智能监督和控制的一种方法,受到隐写推理可能性的威胁,其中大语言模型将他们的推理隐藏在看似无害的文本中。两种相邻的功能,即隐写消息传递(传递隐藏的消息)和编码推理(以难以辨认但未隐藏的格式进行推理),已经被证明是在真实管道中出现的训练压力下出现的,例如针对监视器的强化学习。这表明隐写推理也可能作为训练的意外副作用而出现。在这里,我们比较了模型在三种启发方法中学习隐写推理和这两种相邻功能的容易程度:强化学习、上下文学习和监督微调(SFT)。对于大多数任务,模型仅在 SFT 下学习隐写推理,而在所有三种启发方法下学习隐写消息传递和编码推理。即使在 SFT 下,隐写推理也需要至少两倍于消息传递的训练,并且对于几种模型-任务组合来说,根本不需要学习。然而,在使隐藏信息特别方便的掩护任务中,在所有三种启发方法下都可以成功学习隐写推理。因此,隐写推理比隐写消息传递和编码推理要困难得多,学习后两者并不意味着学习前者。然而它是触手可及的:当掩护任务方便隐藏信息时,在每种启发方法下都可以学习到一个简单的版本。