论文
动态潜在路由
Dynamic Latent Routing
摘要
我们研究了具有时变奖励函数的马尔可夫决策过程(MDP)中子策略的时间串联。我们引入了通用 Dijkstra 搜索(GDS),并证明可以通过中间最优子策略的时间组合来恢复全局最优目标达成策略。受 GDS 背后的“搜索、选择、更新”原则的启发,我们提出了动态潜在路由(DLR),这是一种语言模型 后训练 方法,可在单个训练阶段通过动态搜索来联合学习离散潜在代码、路由策略和模型参数。在低数据 微调 设置中,DLR 在四个数据集和六个模型中匹配或优于受监督的 微调,实现了 +6.6 个百分点的平均增益,而先前的离散潜在基线始终低于 SFT。机制分析和有针对性的代码消融表明,DLR 可以学习具有不同因果角色的结构化路由行为。