论文

分层对齐:通过逻辑一致性在 LLM 中执行分层指令遵循

Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency

模型训练监督微调与指令调优

摘要

大语言模型 越来越多地在来自具有不同权限级别的异构源的多个指令下运行,包括系统策略、用户请求、工具输出和检索的上下文。虽然之前关于指令层次结构的工作强调了尊重指令优先级的重要性,但它主要关注对抗性攻击,而忽略了现实应用中出现的良性但常见的指令冲突。在这种情况下,模型不仅必须避免安全违规,而且在指令部分或隐式冲突时保持任务效用和行为一致性。我们提出神经符号分层对齐(NSHA),通过显式建模和强制执行指令优先级来实现分层指令遵循。在推理时,我们引入求解器引导推理,将指令解析表述为约束满足问题,使模型能够在分层约束下导出一组最大一致的适用指令。在训练时,NSHA 使用自动构建的监督将基于求解器的决策提炼为模型参数。我们评估了我们在规则遵循、任务执行、工具使用和安全方面的方法,涵盖单轮和多轮交互,并表明 NSHA 在此类冲突下显着提高了性能,同时在参考设置中保持了竞争性效用。