论文

CARE-RL:能力感知更新缓解多领域强化学习冲突

CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts

模型训练强化学习

摘要

可验证奖励强化学习已改善模型推理,但推广到多领域时仍面临开放任务奖励不可靠和领域能力干扰。CARE-RL结合协议感知奖励生成与能力感知优化。协议感知生成奖励模型(PA-GRM)先建立提示级评测协议和结构规范,再依据执行轨迹生成奖励,使开放回答既能按任务评价又保持可比。方向感知能力子空间投影(DACSP)从历史RL阶段提取能力方向,增强新更新中一致的分量,抑制冲突分量,保留正交分量。数学、对话及指令遵循实验中,方法稳定优于普通多领域RL基线,Qwen2.5-7B与Qwen3-4B的Total Avg得分分别为47.9和50.7。