论文
TriAlign:迈向个性化LLM对齐中的普适真值一致性
TriAlign: Towards Universal Truth Consistency in Personalized LLM Alignment
摘要
个性化的大语言模型根据用户的偏好和社会属性调整响应,但可能会在社会群体之间引入普遍真理的实质性不一致,其中一些群体系统地收到对客观任务不太准确的响应。现有的对齐方法要么忽视个性化,要么主要注重主观偏好对齐,很大程度上忽视了普遍真理的公平性和一致性。为了解决这一差距,我们研究了真理不变对齐(TIA),这是个性化大语言模型的对齐问题,旨在确保普遍真理在社会群体中保持一致,同时保留个性化。我们提出了 TriAlign,这是 TIA 的第一个离线多智能体强化学习 (MARL) 框架,其中每个社会群体都被建模为一个交互的智能体。 TriAlign 通过公平意识目标和明确的不一致惩罚,共同优化普遍真理准确性、跨组真理一致性和个性化。跨不同基准的实验表明,与强基线相比,TriAlign 在这三个目标之间实现了更强的平衡,减少了社会群体之间普遍真理的差异,同时提高了客观任务绩效和个性化质量。
