论文
PersonaDual:通过自适应推理平衡个性化与客观性
PersonaDual: Balancing Personalization and Objectivity via Adaptive Reasoning
摘要
随着用户日益期望LLM契合自身偏好,个性化信息变得有价值。然而,个性化信息是把双刃剑:它可以改善交互,但也可能损害客观性与事实正确性,尤其当它与问题不一致时。为缓解这一问题,我们提出PersonaDual,一个在单一模型中同时支持通用客观推理与个性化推理、并依据上下文自适应切换模式的框架。PersonaDual先用SFT学习两种推理模式,再通过我们提出的DualGRPO进行强化学习优化模式选择。在客观与个性化基准上的实验表明,PersonaDual在保留个性化收益的同时减少干扰,实现接近无干扰的性能,并更好地利用有益的个性化信号来改进客观问题求解。
