论文

隐藏思维并非秘密:LLM中的推理轨迹暴露

Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs

模型评测安全与风险评测

摘要

推理轨迹已成为一种宝贵的学习信号,可用于提升和迁移大型语言模型(LLM)的能力。尤其是详细的轨迹有助于将推理行为从更强的教师模型蒸馏到较弱的学生模型中。能力迁移的价值促使许多部署了推理模型的系统隐藏原始内部轨迹,最多只向用户暴露摘要和答案。因此,我们提出这样一个问题:这种接口层面的轨迹隐藏是否能阻止用户通过提示(prompting)获得有用的推理监督。我们用Reasoning Exposure Prompting(REP)来研究这一问题,这是一种轻量的上下文内引导方法,使用由影子模型生成、并包装在辅助类代码格式中的示范样本,从受害模型中引出用户可见的推理轨迹。在常见推理数据集、不同受害模型以及不同学生模型蒸馏设置下,REP显著提高了暴露轨迹与REP条件下内部轨迹之间的相似性,同时保留了有用的推理信号。

隐藏思维并非秘密:LLM中的推理轨迹暴露:论文配图
图 1:REP 概述。 REP 从辅助数据集 DdemoD^{\mathrm{demo}} 构建 kk-shot 推理演示 SkS_{k},使用包装器 T⁡(⋅)T(\cdot) 对其进行转换,并将生成的演示添加到每个目标问题 q∈Dsq\in D^{s} 中。然后,受害者模型 MvM_{v} 被提示生成用户可见的公开推理 r2r_{2} 和最终答案 aa。