论文
说服攻击可降低CoT监控的有效性
Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring
摘要
思维链(CoT)监控是基于“可见推理痕迹可浮现未对齐或欺骗行为”之前提的有前景AI智能体安全机制。虽然在标准场景中有效,近期工作强调LLM仍易受说服式越狱影响——自然语言论据可压过模型约束。我们压力测试该脆弱性是否延伸到监控LLM:对抗智能体能否说服其CoT监控器批准违反监控器策略的提议动作?我们设计含40个任务的评估框架,分析数千次智能体—监控器交互——智能体被指示为违反策略的提议辩护。我们发现:在此对抗设定下,监控器访问智能体的CoT推理平均使有害动作的批准增加而非减少9.5%——草稿板提供了额外的说服通道。为解决此点,我们引入事实核查监控框架。我们发现来自不同模型家族的事实核查器与监控器配对(例如Claude 3.7 Sonnet监控器配GPT-4.1事实核查器)把违规策略动作的批准最多降低45%——而同一模型兼任事实核查与监控时仅降6%。结果表明仅CoT监控可能不足以对抗对抗性说服,模型多样的事实核查提供鲁棒缓解。
