论文

DNAlign:LLM的动态零空间安全对齐

DNAlign: Dynamic Null-Space Safe Alignment for LLMs

模型训练偏好优化

摘要

确保大语言模型安全可靠部署仍是根本挑战。既有安全对齐方法或计算成本高,或无意破坏模型核心知识,导致良性任务的流畅性与事实准确性退化——这暴露了安全与效用间的持续权衡。我们提出DNAlign,一个集成控制论优化与零空间投影的轻量对齐框架:把LLM视为动态系统,引入可控扰动引导生成走向安全行为;关键组件是投影模块,把扰动限制在从中性隐状态导出的有害相关子空间内,从而保留通用知识与响应质量;以人类偏好数据训练的价值函数自适应优化控制信号以对齐人类安全偏好。跨多个LLM骨干的大量评估表明该框架持续减少有害输出同时保持流畅性、连贯性与事实效用;总体性能优于既有对齐基线且不牺牲生成多样性。结果表明该框架为安全LLM对齐提供有效且实际可部署的方案。代码/项目页:https://anonymous.4open.science/r/DNAlign。