论文

通过Meta-LoRA学习跨领域偏好自适应,实现大语言模型个性化

Learning to Adapt Cross-Domain Preferences via Meta-LoRA for LLM Personalization

模型训练监督微调与指令调优

摘要

跨领域零样本或少样本个性化旨在仅凭少量目标领域交互,就在未见过的对话领域中生成符合用户偏好的回复。现有自适应方法难以在证据稀疏时校准更新幅度,因而容易过拟合;而历史迁移方法常将用户偏好与源领域伪影纠缠在一起,产生不可靠的个性化先验与负迁移。为了按证据质量校准自适应,我们提出PAC-Bayes正则化的Meta-LoRA,它以元学习的LoRA初始化同时作为自适应起点与先验中心,并根据支持集规模与预测不确定性调整更新强度。这在证据稀疏或含糊时抑制过拟合,同时允许随证据增多而加强个性化。仅控制自适应并不能决定哪些偏好应跨领域迁移以及应如何表达。因此我们把个性化先验按功能分解为用户与领域两个部分:用人类可读的提示词承载稳定偏好,用保持拓扑的soft token实现领域相关的隐空间条件化。在多个基准与个性化任务上的实验显示,方法相对强基线取得一致增益。在HiCUPID上,与最强竞争基线相比,本方法将跨领域胜率退化降低47.9%,并在未见用户冷启动下将胜率提升110.2%。

通过Meta-LoRA学习跨领域偏好自适应,实现大语言模型个性化:论文配图
图1:跨域 LLM 个性化问题示意图,该问题呈现少样本过拟合与跨域差距挑战。