论文

相同的词元是否意味着相同的状态? MoE 路由作为推理控制信号

Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

模型推理推理验证与自校正

摘要

在稀疏专家混合语言模型中,相同的 token id 是否意味着相同的路由器状态和产生它的相同专家?将发出的词元 ID 固定在重复的锚点上,我们发现事实并非如此:生成它的专家仍然独立的任务上下文、轨迹历史和推理努力模式。此残差结构支持测试时间控制:在 \emph{boundary} 锚点(最终响应转换)和 \emph{delimiter} 锚点(打开答案,例如 \ \texttt{\textbackslash boxed\{} 或代码栅栏)附近,路由邻域已经在仅标记读数处与​​最终答案盆地对齐,并且在答案开口处读取路由时最强。我们将其操作为 \textbf{RAD} (路由协议解码),一个无答案字符串的多转出选择器:它定位一个固定锚点,通过其锚点窗口 MoE 路由状态表示每个转出,并返回最密集的加权 Jaccard $K$-NN 路由盆地中心,无需解析、标准化、执行或对答案字符串进行投票。在 10 个稀疏 MoE 配置(gpt-oss、Qwen3-MoE)和 6 个涵盖数学、GPQA 和代码的数据集中,RAD 与多数派相当,其中字符串投票适定,具有较小的正配对增量(RAD $73.9$ / RAD+DC $74.2$ vs.\ Majority $73.6$)。与多数投票一样,RAD 不是验证者:密集的 \emph{wrong} 盆地仍然可以获胜。它的价值在于接口:相同的选择器在代码上提供直接 pass@1,其中精确字符串投票定义不明确,并且相同的路由密度原则,重新锚定到代理边界,改进了 SWE-bench 上的 best-of-16 补丁选择,经过随机验证,其中补丁没有答案字符串可供投票。