论文

被污染的计划、看似干净的轨迹:计划注入规避思维链监控

Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection

模型评测安全与风险评测

摘要

思维链监控是让监控器,通常也是语言模型,检查执行模型推理中的不安全规划、欺骗或失配迹象。我们发现,在执行者上下文植入有害但听来无害的推理,可引导其采取对抗动作并规避监控,称为计划注入。我们首先使用Li等2025年的调查智能体诱发框架,在Lanham等2023年的多选问答可监控性场景发现攻击。推广后,它适用于更难任务,在不同基准上监控规避率达25—33%,也适用于DeepSeek-R1等更大模型。在所研究设置中,执行者不仅遵循注入计划,还改写成自身推理,不明确归因于注入。最后我们发现额外监控资源有时有害:让监控器读取注入计划,在Bio-Math任务上使检测下降最多50%;另一个监控推理预算案例中,更多思考token被用于合理化注入计划而非标记它。

被污染的计划、看似干净的轨迹:计划注入规避思维链监控:论文配图
图1:调查智能体发现的提示策略在引导效果与隐蔽性之间的前沿。调查者、执行者和监测者均为Qwen2.5-Coder-7B-Instruct;每个点是一种追加到TruthfulQA选择题的提示策略。纵轴为诱导错误思维链的比例,横轴为其中被监测发现的比例,颜色表示未被发现的比例。左上方策略更能诱导执行者并逃避监测。