论文
语言模型遵守行为限制,不代表能明确说出这些限制
Do Language Models Know Their Own Constraints?
摘要
我们询问通过后训练获得的行为约束是否仍可明确报告。使用约束配方生成作为测试平台,通过 Llama 3.1 8B Instruct 的 LoRA 微调强制执行五种禁用成分,我们将监督微调 (SFT) 和组相对策略优化 (GRPO) 与四层约束意识基准上的未经训练的基线进行比较。对三个种子进行平均,两种方法都将行为依从性从 4% 提高到约 90%,同时减少了低于未训练模型的显式约束报告(SFT 为 0.48/5 到 0.16/5,GRPO 为 0.07/5),并侵蚀了保留的第三人称知识(SFT 为 93% 到 36%,GRPO 为 14%;方法之间的 p 小于 0.01)。与我们最初的假设相反,基于奖励的信号是两者中更具破坏性的:无论框架如何,惩罚禁用成分标记的奖励都会学习上下文独立的抑制,而不是自我导向的约束。旨在教导自我区分其他事物的环境条件奖励失败了,最终崩溃到包含在这两个框架中。探测提示时间隐藏状态以 83.8%(第 24 层 MLP)恢复每种成分的回避率,但仅比每种成分的基本率预测器(77.4%)高出 6.4 个点,并且模型自己的口头自我报告仍然更准确(87.8%)。添加明确的自我描述示例的阳性对照不会恢复报告。因此,失败特定于枚举请求的约束,而不是对它们的一般访问权限丧失。