论文
LLMS 中针对性减害的高效模块化框架
An Efficient and Modular Framework for Targeted Harm Mitigation in LLMS
摘要
大型语言模型 (LLM) 是强大的零样本学习器,但仍然容易与人类偏好不一致,通常会产生有偏见、有毒或其他有害的输出。现有的对齐方法虽然有效,但成本高昂且与模型紧密耦合,限制了灵活性和可扩展性。我们提出了一个模块化校正框架,该框架通过激活的 LoRA (aLoRA) 适配器和上下文感知路由机制来增强预训练的 LLM,以消除模型响应不一致带来的危害。我们的方法使专家适配器能够激活中间序列而不会使 KV 缓存失效,从而在生成过程中实现低延迟、有针对性的纠正。每位专家都接受过训练,可以检测和减轻特定危害,例如偏见或毒性。学习路由器根据模型中间输出动态选择合适的专家。我们证明,我们的系统提高了标准安全基准的一致性,同时保持任务性能,为更安全、更可控的大语言模型部署提供了一条轻量级、高效的途径。