论文

NEST:初生编码隐写思维

NEST: Nascent Encoded Steganographic Thoughts

模型评测安全与风险评测

摘要

监控思想链 (CoT) 推理是大语言模型 (LLM) 代理的基本安全技术;然而,如果模型学会隐藏其推理,这种监督就会受到损害。我们探索隐写 CoT(模型将秘密推理隐藏在无害文本中)的潜力,为风险评估和部署策略提供信息。我们系统地评估了 28 个模型(从过去几代到当前前沿)的隐写能力的限制。我们测量四个数据集的监控规避、拒绝率、编码保真度和隐藏任务准确性,将隐写离合诗与简单推理和填充token基线进行比较。我们发现当前模型尚无法支持复杂数学和算术任务的隐藏推理。然而,在简化的计数实验中,Claude Opus 4.5 在隐藏任务上实现了 92% 的准确率,展示了新生的能力。值得注意的是,在极少数情况下(<1%),GPT-5.2 可能会拒绝隐写指令,同时遵守它们。我们的研究结果强调了持续评估隐写风险的必要性。这项研究提供了一种方法来预先检测和防止隐藏的推理,这些推理可能会助长错位的阴谋和欺骗行为。

NEST:初生编码隐写思维
图4:按模型划分的隐写计数能力,在所有 D 值上取平均。柱形显示每个数字的准确率并带标准误差线。标注显示总试验次数(n)和拒绝次数(ref)。Claude Opus 家族(蓝色)显示出最高能力,而 GPT 模型表现中等,其中一些表现出较高的拒绝率。