论文
抵制、更新、拒绝:偏好优化安装了依赖于优先级的可靠性开关
Resist, Update, Reject: Preference Optimization Installs a Prior-Dependent Reliability Switch
摘要
要求保持其答案以对抗操纵源的一致模型仍然必须更新可靠的源并拒绝不可靠的源:抵抗、可靠更新和不可靠源拒绝是一种三向契约,而不是三种独立行为。我们表明,大多数反阿谀奉承工作优化的目标在来源可靠性方面是非同一性的:因为没有偏好标签取决于来源是否实际上可靠,手臂的任何标量混合都会追踪单个尊重刻度盘,并且没有任何点将两个仅在声明的可靠性方面不同的相同模板证词分开。这种固定$\leftrightarrow$易受欺骗边界是目标的属性,而不是任何模型的属性。我们通过数据来识别可靠性:一个阈值基准,其中消息来源在声明其可靠性 $r$ 的同时断言相反的答案,并且正确的操作是翻转当且仅当 $r$ 超过模型的先前强度 $p$。平衡覆盖范围上的偏好优化安装了一个依赖于先验的可靠性开关:在 Qwen2.5-7B 上的三个种子中,指示阈值 $r^\star$ 随先验单调上升,决策精度达到 $0.84$,具有单调翻转曲线(Spearman $0.56$),并且该策略概括为看不见的可靠性值和保留的符号,遵循规定的可靠性而不是角色声望。三个控件定位了原因:不匹配的变体同等地安装开关(0.80 美元),第二偏好优化器(IPO)同样安装它(0.86 美元),而监督模仿则不然(0.50 美元),因此原因是偏好优化超过了可靠性标记的覆盖范围,而不是配对、丢失或模仿。验证电池在新的测试抽签上复制开关,诚实地限制它(它的关键是证词中所述的可靠性,而不是单独审计的记录),并将其传输到 Llama-3.1-8B。前沿是经验的,而不是定理。