论文

保持分布支持的对齐与有界过滤的局限

On the Limits of Support-Preserving Alignment and Bounded Filtering

模型评测安全与风险评测

摘要

论文研究重塑基础模型输出分布的对齐方法,与计算资源有界的安全过滤组合后,能否将有害行为概率降为零。此前研究表明有害行为可在偏好对齐后持续存在,外部过滤在最坏情况也可能计算困难;但主要保持内部表示的实际对齐流程能否彻底消除有害行为仍不清楚。论文将其形式化为保持分布支持的对齐算子,与黑箱、白箱和统计查询访问下的有界过滤算法,分析其近似理想全量有害概率消除器的能力。计算和信息理论分析指出,在这些约束下,有界过滤可能无法消除基础分布支持的全部有害输出。研究通过 OpenRouter 访问多种权重开放与托管大模型,在整理的网络安全场景和 PKU-SafeRLHF 对抗提示上,比较三类过滤器与查询预算。额外过滤计算降低估计有害输出率,但各设置持续在零以上形成平台,提示存在经验性风险下限。