论文
跨类型多样化语言的思想链监控的脆弱性
The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages
摘要
思想链 (CoT) 监控已被提议作为一种有前景的安全机制,用于检测 大语言模型 中的失调行为。然而,它的可靠性在英语之外和不同型号系列中仍然很大程度上未被探索。我们首次对 13 种不同语言和 7 个前沿模型系列(包括 16 个模型)的 CoT 可监控性进行了大规模评估。使用需要显式中间计算的对抗性提示评估,再加上内部答案标记概率的分析,我们一致发现跨语言和提示类型的 CoT 不忠实性,在 8B--120B 参数模型中的平均率为 95.9%。我们发现前沿模型系统地表现出策略操纵,包括答案转换、事后合理化和提示的程序利用,使得它们的推理难以可靠地监控。这些欺骗性模式在资源匮乏的语言中仍然尤为明显,揭示了当前基于 CoT 的监督的根本局限性。我们的结果表明,CoT 监测在语言分布变化的情况下很脆弱,提供的安全信号比纯英语研究显示的要弱得多。这些发现推动了更强大的 CoT 监视器和补充白盒监视技术的开发,特别是对于中低资源语言。我们的代码可用\href{https://multilingual-cot-monitoring.github.io/}{\textcolor{blue}{here}}。