论文

PersonaDual:通过自适应推理平衡个性化与客观性

PersonaDual: Balancing Personalization and Objectivity via Adaptive Reasoning

模型训练强化学习

摘要

随着用户日益期望LLM契合自身偏好,个性化信息变得有价值。然而,个性化信息是把双刃剑:它可以改善交互,但也可能损害客观性与事实正确性,尤其当它与问题不一致时。为缓解这一问题,我们提出PersonaDual,一个在单一模型中同时支持通用客观推理与个性化推理、并依据上下文自适应切换模式的框架。PersonaDual先用SFT学习两种推理模式,再通过我们提出的DualGRPO进行强化学习优化模式选择。在客观与个性化基准上的实验表明,PersonaDual在保留个性化收益的同时减少干扰,实现接近无干扰的性能,并更好地利用有益的个性化信号来改进客观问题求解。

PersonaDual:通过自适应推理平衡个性化与客观性
图2:PersonaDual 框架总览。PersonaDual 为单个 LLM 配备两种互补的响应模式——客观推理与个性化推理,并学习根据用户查询和可用的 persona 在两者之间自适应选择。训练遵循两阶段范式:先以监督学习解缠两种推理行为,再通过 DualGRPO 精炼具上下文感知的模式选择。该设计在获得对齐 persona 线索收益的同时,减轻无关或未对齐 persona 带来的干扰,同时提升客观正确性与个性化质量。