论文

用蒸馏揭露模型隐瞒行为,或提取能力而减少行为迁移

Distillation for Incrimination and Distillation for Capabilities

模型优化模型评测蒸馏安全与风险评测

摘要

能力强但失对齐的AI模型可能识别对齐评测并策略性地表现良好,使直接审计无法提供有效信息。不过,将这种模型蒸馏到较弱、行为良性的学生模型,会使教师陷入“蒸馏双重约束”:如果失对齐行为被迁移,学生可能较难隐藏它,从而暴露教师的问题;如果没有迁移,学生则可能在保持良性的同时学到有用能力。我们提出分别针对这两种结果的蒸馏方法。“揭露问题的蒸馏”(DFI)旨在迁移失对齐行为而不迁移隐藏行为的能力。把AuditBench中保守秘密的模型蒸馏到其底层指令微调模型后,学生在被询问时承认隐藏行为的概率显著高于教师,说明对行为的知识比隐藏倾向更容易迁移。当学生与教师不共享预训练底座时,这种承认行为的增益大多消失。因此,DFI应使用教师自身强化学习之前的检查点作为学生,它较弱但共享底座。“能力蒸馏”(DFC)旨在迁移能力而不迁移失对齐行为。在所评估的技术中,接种式提示,以及在更少的不同样本上训练更多轮,均有效。它们保留了常规蒸馏的能力增益,同时显著减少动物偏好的潜隐迁移;动物偏好在本实验中用作失对齐的代理指标。这些结果展示了蒸馏用于AI安全的两条路径:揭示模型的失对齐,以及提取其能力而不继承失对齐。