论文

内部国家调查读的是情况,而不是行动:行动前失调监测的三个负面结果

Internal-State Probes Read the Situation, Not the Action: Three Negative Results for Pre-Action Misalignment Monitoring

模型评测模型行为与机制分析

摘要

如果模型内部的探针在生成有害文本或工具操作之前识别出这些操作,则可以帮助监控代理系统。我们询问内部读数何时支持这种更强的行动前主张,而不仅仅是描述提示、结构对比或当前轨迹。我们测试了三个模型系列中的三种方法:Qwen2.5-Coder-32B-Instruct 微调/基本方向、Llama-3.1-8B-Instruct 对不安全预填充的最后一个标记进行探测,以及用于勒索工具操作场景中的投影和转向的 Gemma-3-27B-IT 情感概念向量。在这些情况下,结构有效性、语义易读性和引导效果不会成为强大的行动前监视器:每一个都被泛化或特异性检查削弱。 Qwen 方向在 AUC 1.000 处将微调与基础分开,但在 0/143 审核的预辅助转弯上下文和 0/342 Qwen 预填充行上跨越了阈值,其中模型继续不安全的轨迹。 Llama 具有几乎完美的解码提示域(AUC 0.999),而最好的未来行为探测器达到 AUC 0.801,并且仅比大多数探测器精度提升 +5.1 pp;单源跨域传输在六个有序对中的五个上是非正的。 Gemma 情感预测在语义上是有意义的,但共享前缀最小对在第一个不同输入之前具有无法区分的状态,并且针对不相关的学习方向(如猫、天气、运动和地理)的转向特异性会减弱。我们提供了一种将内部读出的声明转换为行动前测试的方法,并报告范围内的负面结果:监控声明必须在场景/行动概括和概念特异性控制中生存。代码发布于 https://github.com/maxf-zn/misalignment_monitoring