论文

Swiss-Knife:解码时可重构外部化多目标对齐的框架

Swiss-Knife: A Framework for Reconfigurable Externalised Multi-Objective Alignment at Decode Time

模型推理解码与生成控制

摘要

解码时对齐方法通过使用外部奖励对候选延续进行评分并选择最大化来引导冻结的语言模型。我们认为,这种共享设计是更大空间中的一个退化点。我们引入了 Swiss-Knife,这是一个用于外部化多目标对齐的框架,其中对齐规范是一流的运行时对象:可热插拔的刻划刀片、批量归一化器、成对聚合运算符和选择规则。六个公理描述了可接受的聚合算子,并且我们证明了一个表示定理:满足它们的每个算子都具有形式 $R_i = \sum_{j \neq i} g((\mu_i - \mu_j)/s(\sigma_i,\sigma_j))$,一个包含概率和逻辑比较规则以及作为命名坐标的逐点 argmax 的二参数族。其中,成对聚合在对抗性奖励污染下是 Lipschitz 稳定的,而 argmax 则不然,候选批量归一化 (CBN) 使权重单纯形对于重新缩放保持不变,而奖励模型只能在重新缩放时被识别。我们的参考实例将 DPO-LoRA 刀片与不确定性感知配对锦标赛配对。横扫有用性/诚实性/无害性单纯形,它获得了六种解码时间方法的最佳平衡边界(最强基线的谐波 $F_1$ 0.797 vs. 0.750,$p < 10^{-14}$),具有最低的拒绝率和最高的有用性,并且在 0.05 毫秒内重新配置其目标,无需梯度计算。消融 CBN 成本为 0.217 $F_1$,元数据证实了预测的机制:方差最低的叶片保留了其名义 33% 影响力的 9%,并且崩溃遵循预测的顺序。