论文

CARD:面向个性化文本生成的簇级适配与奖励引导解码

CARD: Cluster-level Adaptation with Reward-guided Decoding for Personalized Text Generation

模型推理解码与生成控制

摘要

将大语言模型适配到个体用户仍然具有挑战性,原因在于细粒度个性化与可扩展部署之间的张力。我们提出CARD,一个通过渐进式精化实现有效个性化的分层框架。CARD首先根据共享的风格模式对用户聚类,并学习簇级LoRA适配器,从而实现稳健的泛化和较强的低资源性能。为捕捉每个簇内的个体差异,我们提出一种隐式偏好学习机制,将用户自撰文本与簇级生成结果进行对比,使模型无需人工标注即可推断用户特定的风格偏好。在推理时,CARD仅通过轻量级用户偏好向量与低秩logit修正将个性化注入解码过程,同时保持基础模型冻结。在LaMP和LongLaMP基准上的实验表明,CARD相比最先进基线取得相当或更优的生成质量,同时显著提升了实用个性化文本生成的效率与可扩展性。

CARD:面向个性化文本生成的簇级适配与奖励引导解码 配图
图 1:CARD 框架概览。* 紫色组件对应组级个性化,橙色组件表示用户级个性化。黑色实线箭头表示模型的执行流程,蓝色文字表示数据流。