论文
多种偏好,少量策略:用于多目标 LLM 对齐的紧凑组合
Many Preferences, Few Policies: Compact Portfolios for Multi-Objective LLM Alignment
摘要
调整 大语言模型 (LLM) 需要平衡相互竞争的目标,例如有用性、无害性和简洁性。适当的平衡因用户和应用程序而异,但跨不同奖励权重的许多策略的训练、评估和部署成本高昂。我们研究如何识别 LLM 的小型投资组合,在所有奖励权重中保持接近最佳的性能。我们提出了 PALM(对齐 LLM 的组合),这是一种结合了权重向量结构化网格、仅在需要时优化策略的惰性搜索以及修剪的算法。给定目标近似容差,PALM 返回一个投资组合,该投资组合可证明包含每个权重向量的近乎最优策略,并具有明确的投资组合规模上限。此类组合可以支持可扩展的个性化、模型开发过程中的奖励权重探索以及紧凑的解码时间配置。实验表明,与通过均匀间隔或随机采样权重构建的相同大小的投资组合相比,PALM 通常可以实现更小的近似差距。我们进一步证明 PALM 通过高效搜索和稀疏偏好结构有效地扩展到更高维度的奖励空间。