论文

同步Logit引导:真实世界隐写术

Synchronized Logit Steering: Real-world Steganography

模型推理解码与生成控制

摘要

大语言模型中的隐写术提供了一种在听上去自然的文本中嵌入隐藏消息的方法。现有token与logit级方法通常要求收发双方共享完全相同的提示上下文,而这在使用检索增强生成或专有系统指令的生产流水线中很难得到保证。我们提出同步Logit引导(SLS),一种确定性隐写方案,它通过从生成输出本身导出代理提示来消除这一依赖,使双方无需访问原始提示即可重构相同的logit分布。SLS将载荷值编码为代理提示分布高熵区域内的token排名,并以周期性递归与载荷突发扩展该方案以提升信息密度。在ShareGPT、GSM8K与SWE-bench Verified上,我们表明一旦同步窗口达到40个token,真实提示与代理提示分布之间的KL散度便降至0.5 nat以下,且相对贪心生成,SLS编码不会实质性破坏这种收敛。我们还发现周期-突发变体达到每token 0.20比特,约为单载荷编码容量的10倍。Kolmogorov-Smirnov检验进一步证实SLS输出在统计上难以与贪心生成区分,表明经由LLM的、与提示无关的隐蔽通信既实用又隐蔽。

同步Logit引导:真实世界隐写术:论文配图
图1:真实提示分布与代理提示分布之间的平均 KL 散度,在每个数据集的 50 个提示上取平均。该散度在 n=40 时接近 0.5 nats,并在 n≈50 时完全稳定。