论文

T-Router:通过参数高效的强化学习学习丘脑路由以进行推理

T-Router: Learning Thalamic Routing for Reasoning with Parameter-Efficient Reinforcement Learning

模型训练参数高效训练

摘要

参数高效强化学习旨在通过预训练模型的紧凑可训练接口来改进推理。我们引入了丘脑路由器(T-Router),它将适应集中在已完成计算的重用上。压缩的、可寻址的存储体保留块更改;深度循环控制器控制它们的选择和相对规模写回。这种耦合为丘脑上下文相关的路由提供了一种具体的计算形式:了解接收层使用哪些早期贡献以及具有什么影响。正确性奖励训练接口,同时保留骨干参数和层顺序。在 8.95B 参数主干上,T-Router 分配 41.73M 个参数(主干的 0.466%),并在 GSM8K RL 后实现 83.64 +/- 1.16 MathAvg,而三轮评估中全参数 GRPO 的数学平均值为 73.79 +/- 1.83。在相当的参数预算和匹配的重试下,它超过了 LoRA 的 77.28 +/- 1.95 MathAvg,改进了所有三个任务系列,并将平均 AIME 准确度从 48.33 提高到 60.56。容量控制的比较有利于可寻址的块更改和循环上下文;单独的搜索训练将接口扩展到以工具为中介的推理。这些结果将受控计算重用确立为参数高效推理强化学习的有效途径。