论文
安全对齐的LLM从混合合规示范中学到什么?
What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?
摘要
先前工作表明上下文示范可以越狱语言模型——但模型如何解读不同类型的合规示范仍不清楚。我们通过把良性合规示范(无害请求、有帮助的响应)与有害合规示范(有害请求、有帮助的响应)混合——并检验关于示范构成如何驱动有害合规的三个假说来研究。跨四个模型——我们发现良性与有害示范不可互换:依模型而定——良性示范可能降低也可能增加有害合规。我们进一步表明:偏好优化是防止良性示范增加有害合规的关键训练阶段;示范排序展现强近因偏置——且模型在拒答与上下文学习的交互上不同:一些模型即使在拒答时也采用示范的格式——另一些则在拒答时覆盖全部上下文信号。合起来——本工作超越“示范式越狱有效”的证明——转而刻画其如何起效:模型从合规示范中提取什么取决于示范内容、排序与训练方法学。
