论文

模型内部何时有帮助?探索表示工程在LLM安全中的作用

When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

模型评测安全与风险评测

摘要

可靠的人工智能保障措施需要减少不安全行为的控制机制和在模型交互过程中检测安全风险的监控机制。既定的行为保护措施包括优化模型输出的对齐方法和评估交互文本的文本监视器。相反,表示工程读取或修改内部模型状态,但这些方法的相对优势仍不清楚,因为它们经常在不同的设置下进行评估。我们对两个轨道进行了匹配的评估。对于安全控制,我们将 DPO(一种行为对齐方法)与三种表示转向方法在鲁棒性、实用性和粒度方面进行了比较。 DPO 提供了最强的整体控制,并且通常会随着训练数据的增加而提高,尽管其安全性在后续的良性微调后可能会降低。表示转向主要在低数据环境中仍然具有竞争力,特别是在高质量对比数据的情况下。对于安全监控,我们在全响应检测、早期检测和计算成本方面将表示探针与微调和开放权重文本监视器进行比较。专用文本监视器实现了最强的整体检测精度,而表示探针以低得多的边际成本保持竞争力。最后,监控引导的干预措施在良性微调后恢复了 DPO 损失的大部分安全性,几乎没有额外的过度拒绝。总体而言,表示工程通常不会取代行为防护措施,但在特定条件下提供实际优势,并且可以提供补充的安全优势。