论文

PerMix-RLVR:在可验证的奖励调整下保留角色表现力

PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment

模型训练强化学习

摘要

角色提示已被广泛采用来引导 大语言模型 (LLM) 行为并通过分配特定字符来提高其指令性能。然而,识别最佳角色非常耗时,而且其对输出质量的影响仍然知之甚少。先前的工作主要通过推理时间策略在提示级别解决这个问题,从而产生额外的计算。在这项工作中,我们通过在训练期间解决角色敏感性来避免推理时提示搜索,旨在训练模型使其行为适应不同的角色,同时保持任务性能。特别是,我们发现带有可验证奖励的强化学习(RLVR)系统地降低了对角色提示的敏感性,但也揭示了基于结果的优化的固有权衡:虽然 RLVR 提高了具有可验证目标的任务的鲁棒性,但它也会在需要时降低角色表现力,例如角色角色扮演。为了解决这一限制,我们提出了 PerMix-RLVR,这是一种角色混合 RLVR 策略,可以减轻角色鲁棒性与保真度的权衡,保持对有害角色变化的强大鲁棒性,同时在需要时实现忠实的角色采用。具体而言,PerMix-RLVR 在 MATH500 上比 RLVR 提高了角色稳定性得分 (PSS) +21.2%,同时还在 PersonaGym 上将角色保真度提高了 +11.4%。