论文
VISA:面向个性化LLM对齐的屏蔽自适应价值注入
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
摘要
使大型语言模型(LLM)与细微的人类价值观对齐仍是一项关键挑战,因为现有方法如基于人类反馈的强化学习(RLHF)通常只处理粗粒度属性。在实践中,在任务特定数据集上微调LLM以优化价值对齐不可避免地带来对齐税:由于训练数据中潜在偏见的吸收,模型预先校准的价值体系发生显著漂移,同时微调过程还在生成响应中造成严重幻觉和语义信息损失。为此,我们提出VISA(Value Injection via Shielded Adaptation),一个旨在驾驭这一权衡的闭环框架。VISA的架构包含高精度价值检测器、语义到价值转换器和核心价值改写器。价值改写器通过Group Relative Policy Optimization(GRPO)训练,采用同时优化细粒度价值精确性与语义完整性保持的复合奖励函数。通过学习平衡这些相互竞争目标的最优策略,VISA在忠于原有知识的同时有效缓解了对齐税。我们的实验表明,该方法能在保持事实一致性与通用能力的同时,精确控制模型的价值表达,显著优于标准微调方法和基于提示的基线,包括GPT-4o。
