论文
CounterRoute:基于分层反事实信用分配的自路由推理
CounterRoute: Self-Routed Reasoning via Hierarchical Counterfactual Credit Assignment
摘要
具备推理能力的语言模型在直接回答即可满足需求时常常生成冗长的思维链,浪费推理算力。许多双模式模型把这一选择留给用户。将其自动化颇具挑战,因为路由目标随策略演化,初始模式偏好会破坏探索的稳定性,而序列级目标将路由与回答学习纠缠在一起。我们提出CounterRoute,一个在线强化学习框架,直接从原生双模式检查点出发,在单一共享策略中联合学习路由和模式条件化回答,无需方法特定的SFT预热。成对的当前策略反事实rollout只把跨模式信用分配给路由token,而模式内GRPO训练回答token。一个从成对到自路由的课程先用来自两种模式的强制rollout稳定早期训练,再逐步增加自路由更新以提升自主路由能力。在九个基准上,CounterRoute比启发式和习得式自适应路由方法更好地平衡了准确率与效率。相对于总是思考的检查点,它提升宏平均准确率的同时,将Qwen3-8B的平均生成token数减少51%,Qwen3-14B减少41%。在直接回答表现强的指令遵循和常识基准上,思考率最低降至1%而回答质量反而提升。尽管只在数学和指令遵循上训练,其路由行为和回答质量能泛化到留出的编码、科学、知识和常识基准。
