论文

宪法价值潜力:阅读和引导语言模型中的内部优先级边际

Constitutional Value Potentials: reading and steering internal priority margins in language models

模型评测安全与风险评测

摘要

安全评估测试了一项策略,忽略了激励信息部署提供的提示:佣金、绩效分数、标明哪种行动回报最好的仪表板。我们衡量这个遗漏隐藏了什么。在 MoneyWorld 这个综合工作场所环境中,我们在非安全任务上训练了来自三个强化学习系列的五个指令调整模型,其中可见的回报信号识别出一条牺牲任务质量的奖励捷径。然后,我们冻结每项策略,呈现保留的安全冲突,并仅更改显示的信号。每个菜单包含一项合规操作和三项违规操作。我们报告了三项发现,以及 Qwen2.5-14B-Instruct 的评分。 (i) 支付信号控制冻结的安全选择:当信号指定不安全选项时,不安全选择为 100%;当信号被隐藏或指定安全选项时,不安全选择为 0%。隐藏信号和随机信号训练控制保持在 0.3% 或以下,并且转换在所有五个碱基上重现。数字支付在采样动作奖励下重现了这一点,以 1 美元的优势达到 98.6% 的不安全选择。 (ii) 在训练菜单干预下将支付识别和不安全选择分开:在相同支付下完成任务动作的训练保留了 99.8% 的识别率,同时在匹配的更新预算下将不安全选择减少到 7.9%。回报阅读能力本身并不能解释转移。 (iii) 交换机不会在使用相同冻结适配器执行的零售客户服务任务中重现。在 MoneyWorld 中,省略激励信息掩盖了当相同的策略看到哪种行动回报最好时出现的不安全选择。