论文
一种隐写的决策论形式化及其在LLM监控中的应用
A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring
摘要
大语言模型开始展现出隐写能力。这种能力可能使未对齐的模型规避监督机制。然而,目前缺乏检测和量化此类行为的原则性方法。经典的隐写定义以及基于这些定义的检测方法,需要一个已知的非隐写信号参考分布。对于LLM中的隐写推理而言,获知这样的参考分布并不可行,这使得这些方法不再适用。我们提出另一种视角——隐写的决策论视角。我们的核心洞察是:隐写在能够解码与不能解码隐藏内容(隐写信号中所含内容)的智能体之间制造了一种可用信息的不对称,而这种原本潜藏的不对称可以从智能体的可观测行为中推断出来。为将这一视角形式化,我们引入广义V-information:一个用于度量某输入中可用信息量的功利主义框架。我们据此定义steganographic gap——通过比较隐写信号对能解码与不能解码隐藏内容的智能体的下游效用,来量化隐写的度量。我们对该形式化进行了实证验证,并表明它可用于检测、量化和缓解LLM中的隐写推理。
