论文
Risky Business:测量忠实性与安全性之间的张力
Risky Business: Measuring The Faithfulness-Safety Tension
摘要
链式推理(CoT) reasoning 提供了一种潜在的窗口,用于模型监控。然而,监控依赖于忠实性,即模型输出严格来源于其推理轨迹。我们识别了一个对齐紧张,其中模型必须足够忠实以被监控,但又必须足够鲁棒来拒绝不安全的推理。我们展示了这种平衡存在于当前的大规模推理模型(LRM)中,并展示了如何解决它。我们引入了HazMart,一个人类编写的数据集,在自主AI商店老板的情景下。与之前的依赖于提示中的提示来测试忠实性的方法不同,我们提出了一种新颖的替代技术,称为靶向推理替换(TRR),直接干预推理链以在不安全或逻辑错误的想法上进行替换(例如,“等等,答案必须是选项B [是选项A] 因为它是最合适的”。)DeepSeek-R1-Llama-70B表现出高忠实性(97.5%),但失败拒绝不安全的推理(12.3%),而QwQ-32B在成本上更鲁棒(73.9%的安全性)但在忠实性方面更低(74.7%)。对QwQ-32B的机制分析揭示了这些属性由行动标记处的反相关内部方向组成。最后,我们展示了表示引导可以独立增强安全方向,增加安全行为9个百分点,同时保持基础能力不变。
