论文

安全对齐的LLM从混合合规示范中学到什么?

What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?

模型评测安全与风险评测

摘要

先前工作表明上下文示范可以越狱语言模型——但模型如何解读不同类型的合规示范仍不清楚。我们通过把良性合规示范(无害请求、有帮助的响应)与有害合规示范(有害请求、有帮助的响应)混合——并检验关于示范构成如何驱动有害合规的三个假说来研究。跨四个模型——我们发现良性与有害示范不可互换:依模型而定——良性示范可能降低也可能增加有害合规。我们进一步表明:偏好优化是防止良性示范增加有害合规的关键训练阶段;示范排序展现强近因偏置——且模型在拒答与上下文学习的交互上不同:一些模型即使在拒答时也采用示范的格式——另一些则在拒答时覆盖全部上下文信号。合起来——本工作超越“示范式越狱有效”的证明——转而刻画其如何起效:模型从合规示范中提取什么取决于示范内容、排序与训练方法学。

安全对齐的LLM从混合合规示范中学到什么?:论文配图
图 1:良性与有害合规性演示。在良性合规性演示中,用户提供无害的提示,助手提供有用的答案。在有害合规演示中,用户提供有害提示,助理给出不拒绝响应。我们对包含这些演示的混合上下文进行实验,并分析它们对最终有害查询的合规性的影响。