论文
错误的安全对齐:量化并定位LLM对明确证据的误拒
The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs
摘要
本文研究刻板印象与偏见,示例仅用于分析,研究目的不是反对对齐,而是改进对齐方法。安全对齐旨在让大语言模型避免不安全推断,但有时会使模型拒绝上下文明示支持的合理结论。作者称之为误触发对齐,即对齐引起的行为变化覆盖了明确证据。为量化刻板印象相关现象,VETO基准构建2,032组源自BBQ的对比样本,并定义0至100尺度的误触发对齐率MAR:模型在刻板印象相关问题上失败,却在对比问题上成功的频率。25个LLM,包括近期模型,MAR均为4.7%—18.9%,人工参与者均为0%。受控启动实验表明,安全相关提示会显著放大MAR。开放权重模型的机制分析发现,后层会抑制证据支持的答案;指令模型与基础模型比较提示这种抑制在指令训练后出现。结果指出,当前对齐方法可能过度泛化表面安全线索,因而覆盖客观证据,需要更好保留上下文依据的对齐目标。