论文

提示模型说假话时,推理Token会如何变化?

Reasoning-Token Spikes Under Prompted Untruthful Responding in Large Language Models

模型评测模型行为与机制分析安全与风险评测

摘要

监控推理人工智能 (AI) 模型的思想链仍然是检测此类模型中的欺骗和其他形式的不当行为的关键方法。然而,语义思想链监控取决于推理痕迹是否清晰且足够忠实于产生模型行为的底层计算,更不用说可访问性了。此外,越来越多的证据表明,即使思想链输出仍可访问,它们也可能很快变得难以辨认或不忠实。基于认知负载理论,我们研究了较低带宽信号(生成的推理标记的数量),它不需要访问推理跟踪的内容。三个具有推理能力的大型语言模型在系统提示下回答了 210 个多项选择题,涵盖分析性推理、描述性推理和规范性推理类型以及道德和非道德领域,指示它们做出真实、错误或不考虑事实的回答。在所有三种模型中,以事实为导向的反应比以谎言为导向和与事实无关的反应引出的推理标记要少。这些发现表明,明确提示的不真实响应策略可能会在测试时推理Token的使用方面产生强大的群体级别差异。虽然尚未将推理标记计数建立为自发欺骗或一般偏差的检测器,但我们的结果证明了它可以作为一种简单的、与内容无关的候选信号,用于在原始推理痕迹不可用或不可靠时区分不真实的模型行为和真实的模型行为。未来的工作应该测试实例级检测率、分布外泛化、学习欺骗策略、隐藏目标以及对抗压力下的鲁棒性。

提示模型说假话时,推理Token会如何变化?:论文原图
图 1:三个测试模型中“真话”、“谎言”和“废话”条件下的标记计数分布直方图。这些图代表原始提示级别数据(Gemma 为 12,600 个提示,GPT-OSS 为 11,970 个提示,Qwen 为 6,930 个提示)。