论文
Switch-Reasoner:通过强化学习学习何时在多任务混合中思考
Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning
摘要
多模态 大语言模型 (MLLM) 通常遵循固定的思考然后回答范式,这在异构多任务设置中效率低下,因为简单的输入可能不需要明确的推理,而困难的输入可以从中受益匪浅。在 后训练 期间学习何时思考也不稳定,不平衡的执行轨迹可能会导致模型朝着始终思考或始终直接的行为发展。我们提出了 Switch-Reasoner,这是一个基于 GRPO 的框架,可以学习自适应地选择 MLLM 的推理模式。它将思维视为虚拟工具调用,并允许模型直接回答或在回答之前调用显式推理。为了稳定这一决策,我们引入了双层监管机制,平衡思维模式和直接模式的整体使用,同时根据两种选择的相对效益提供样本层面的监管。对 11 个多模态任务的实验表明,Switch-Reasoner 在保持强大性能的同时减少了不必要的推理,实现了更好的准确性-效率权衡。