论文
使用强化学习训练 LLM 以实现意图感知个性化问答
Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering
摘要
语言模型中有效的个性化问答(PQA)需要将响应基于用户的潜在意图,其中意图指的是查询背后超出其明确措辞的隐含“为什么”。然而,现有的意图感知个性化方法依赖于多轮对话上下文或丰富的用户配置文件,并且在推理过程中没有明确地建模用户意图。这限制了它们在单轮设置中的有效性,在单轮设置中,用户的潜在目标必须从最小的输入中推断出来并集成到思考和推理过程中。为了弥补这一差距,我们提出了 IAP(意图感知个性化),这是一种强化学习框架,可训练模型直接从单轮问题推断隐式用户意图,并通过基于标签的模式将其纳入思维步骤,以生成个性化的、基于意图的答案。通过在个性化奖励函数下优化意图感知答案轨迹,IAP 强化了生成路径,使隐含的用户意图变得明确,并产生更符合用户基本目标的响应。通过对六个模型的 LaMP-QA 基准进行实验,IAP 始终优于所有基线,与最强竞争对手相比,平均宏观分数提高了 7.5% 左右,这表明在训练目标中建模隐式用户意图是 PQA 的一个有前途的方向。