论文

一种隐写的决策论形式化及其在LLM监控中的应用

A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring

模型评测评测方法与指标

摘要

大语言模型开始展现出隐写能力。这种能力可能使未对齐的模型规避监督机制。然而,目前缺乏检测和量化此类行为的原则性方法。经典的隐写定义以及基于这些定义的检测方法,需要一个已知的非隐写信号参考分布。对于LLM中的隐写推理而言,获知这样的参考分布并不可行,这使得这些方法不再适用。我们提出另一种视角——隐写的决策论视角。我们的核心洞察是:隐写在能够解码与不能解码隐藏内容(隐写信号中所含内容)的智能体之间制造了一种可用信息的不对称,而这种原本潜藏的不对称可以从智能体的可观测行为中推断出来。为将这一视角形式化,我们引入广义V-information:一个用于度量某输入中可用信息量的功利主义框架。我们据此定义steganographic gap——通过比较隐写信号对能解码与不能解码隐藏内容的智能体的下游效用,来量化隐写的度量。我们对该形式化进行了实证验证,并表明它可用于检测、量化和缓解LLM中的隐写推理。

一种隐写的决策论形式化及其在LLM监控中的应用
图1:所提出的隐写术形式化。左:在隐写术的经典观点中,审计者(Auditor)通过检查消息 Z Z 是否显著偏离某个已知的良性文本参考分布,来评估其是否为隐写的。右:在我们提出的隐写术决策论观点中,我们通过比较有消息 Z Z 时所作决策的效用 d ⁡ [ X aud , Z ] d\big[X^{\mathrm{aud}},Z\big] 与没有消息时的效用 d ⁡ [ X aud ] d\big[X^{\mathrm{aud}}\big] 来检测隐写。含隐写内容的消息 Z Z 对接收者(Receiver,知晓编码方案因而能利用隐藏内容)的效用应高于对哨兵(Sentinel,一个与接收者能力相近但不知晓编码方案的可信智能体)的效用。这使我们能够定义隐写差距(steganographic gap) Δ steg \Delta_{\mathrm{steg}} 作为隐写的度量。