论文
思维链忠实性的引导向量泛化研究
On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness
摘要
模型能力在很大程度上得益于链式思维的扩展。这一发展对于人工智能安全来说是一个有希望的进展,因为模型能够表达其推理过程,从而允许监督。然而,在某些情况下,模型在推理过程中不公开重要的步骤。例如,当模型被提示给出错误答案时,即使这些答案对于其结论来说是必要的,模型也可能不承认这些提示。当链式思维(CoT)无法披露必要的推理步骤时,我们将其描述为不忠实。先前的工作表明,激活引导(activation steering)可以作为一种有用的手段来提高CoT的忠实性。我们扩展了这一研究,通过研究激活引导在三种模型(Gemma-3 4B,Qwen-3.5 9B,Gemma-3 12B)中的效果,这些模型在提示问题和答案的情况下进行。激活引导可靠地增加对大模型(Gemma-3 12B)的提示承认,但当激活引导有效时,其效果在不同类型的提示、数据集和构建激活引导向量的方法上广泛地泛化。在交叉提示和交叉数据集分析中,效果主要由评估设置决定,而不是向量的训练设置。激活引导的构建方法也无关紧要——包括一个优化目标不提及任何特定提示的构建方法,其效果与优化目标提及任何特定提示的构建方法相似。最后,我们考虑激活引导是否促进提示的突出,并导致更多的提示使用,而不是针对语言行为进行优化。然而,我们发现没有证据表明这一点——激活引导使提示使用率大致不变,而减少了未承认的提示使用,即未被承认的提示使用。
