论文
基于多层组合融合的情境化价值对齐
Contextual Value Alignment via Multilayer Combinatorial Fusion
摘要
使大语言模型(LLM)与人类价值对齐仍是一项重大挑战,对可信AI尤为如此。尽管RLHF、CAI及其变体等现有方法已取得可喜成果,它们往往依赖单Agent框架和统一奖励系统,这限制了其捕捉伦理多元性、适应多样道德情境以及反映多Agent道德推理动态的能力。在本工作中,我们提出一个利用多层组合融合实现情境化价值对齐的框架(MCF-CVA)。在框架第一层,实例化多个道德智能体,每个都经过微调以代表一种独特价值。随后用分数组合与排名组合以及平均与加权聚合对它们的输出进行组合式扩展。再将这些组合后的模型约简为与初始道德智能体相同的数量。这一扩展与约简(EAR)过程持续多层进行,直至达到停止准则。MCF-CVA框架利用智能体之间的认知多样性来缓解多Agent间的冲突与冗余,产生更好反映情境化人类价值的回应。采用EAR算法的框架在欧氏分数空间与Kemeny排名空间的双重架构上执行。实证评估表明,所提框架在标准指标上优于单Agent基线、多Agent单层结果以及既有聚合方法,说明MCF-CVA框架为推进大语言模型的情境化价值对齐提供了稳健而有效的机制。
