论文

语言模型是“不安全”的记者

Language Models Are "Insecure" Reporters

模型评测安全与风险评测

摘要

随着大语言模型被部署在日益自主的长期任务中,手动审核和验证模型的操作、工件和输出变得更加困难。相反,用户开始依赖大语言模型生成的报告来评估工作的质量和完整性。我们引入了一套由八个对抗性报告场景组成的套件,以系统地研究大语言模型是否隐藏了改变叙事的缺陷:破坏原本成功的工作描述的错误或限制。我们将这种现象称为“不安全报告”。当机器学习实验日志包含明显削弱所提出方法的植入负面结果时,GPT-5.5 仅在 200 个生成的报告中的 2 个中标记负面结果。然而,当添加简短的诚实指令“诚实地回答”时,模型会在 200 份报告中的 190 份报告中标记出负面结果。在八个开放权重模型中,思想链分析揭示了揭露改变叙事的缺陷与推理如何显得成功之间反复出现的紧张关系。我们对 Qwen3.5-9B 进行了激活分析和转向实验,发现诚实和寻求成功在表示空间中对应于相反的方向。我们的结果表明,大语言模型倾向于默认呈现成功的叙述,而转向诚实的模型使他们的报告更加透明。