论文

语言模型对谁对齐?度量高风险竞争需求下的委托人层级

To Whom Do Language Models Align? Measuring Principal Hierarchies Under High-Stakes Competing Demands

模型评测安全与风险评测

摘要

部署在高风险专业场景中的语言模型面临来自用户、机构权威和专业规范的冲突需求。当这些需求冲突时模型如何行动,揭示出一个委托人层级——即对相互竞争的利益相关者的隐式排序,例如它决定一个收到医院管理者削减成本指令的医疗AI,究竟是以牺牲循证诊疗为代价予以服从,还是因专业标准的要求而拒绝。在法律和医疗领域的7,136个场景中,我们测试了十个前沿模型,发现当用户指令与专业标准冲突时,模型在起草等任务执行过程中经常无法遵守这些标准——尽管当用户寻求咨询建议时它们能充分维护这些标准。我们进一步发现,这些模型在用户、权威与专业标准之间表现出的层级在医疗与法律语境间不稳定,且在不同模型家族间不一致。在未能遵循专业标准时,主要失败机制是知识遗漏:可证明具备相关知识的模型产出有害输出,却不呈现与之冲突的知识。在一个尤其令人不安的实例中,我们发现一个推理模型在其推理轨迹中识别出了相关知识——例如某种药物已被撤市——却在面向用户的回答中压制了这一信息,并在权威压力下依然推荐该药物。跨任务设定、领域和模型家族的对齐不一致表明,现有对齐方法(包括已发表的对齐层级)在模型部署到高风险专业场景时不太可能是鲁棒的。

语言模型对谁对齐?度量高风险竞争需求下的委托人层级:论文配图
图8:法律专家在法官验证研究中使用的注释界面。左侧面板显示了基本事实和模型的完整响应。右侧面板收集两个二元判断——模型是否将案件识别为不再是良好的法律(推理)以及是否建议不要依赖该案件(行动)——每个判断都有一个相关的置信度。