论文

超越轨迹:将可解释的推理状态读出与原生 MoE 路由耦合

Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing

模型评测模型架构MoE模型行为与机制分析

摘要

推理模型写出的内容只是其生成过程的部分记录。我们为混合专家推理引入一个两级内部读出。我们首先将词汇表规模的 J 空间蒸馏为 J64——一个从模型自身推理状态学得的 64 轴语义框架。J64 揭示了输出轨迹所不显示的可读过程状态:它把推理努力与问题诱发的压力分离开。相比以 token 占用读取同一 rollout 并以完全相同方式聚合的基线,它在留出集上增加 0.096 到 0.135 的 AUC。随后我们从原生专家路由统计重建 J64,得到低开销代理 R64:在三个模型与两个家族上,其与 J64 的逐轴相关中位数为 0.69 到 0.86;在 gpt-oss-20b 上,它保留 J64 预测增益的 95% 到 100%。该读出支持两种时间分辨率的测试时决策。在已完成的候选集合上,J64 与 R64 改善单分支选择,R64 加权投票在八个设置中的七个上优于普通多数投票。生成过程中,滚动读出窗口驱动一个累计停止并重采样策略,其工作点仅在训练问题上固定。J64 相对同源置换对照将准确率提高 1.1 到 5.9 个百分点,仅用路由的 R64 代理保留其中 0.9 到 3.2 个百分点。最后,针对 J64 所命名机制的 router 编辑诱导出预测的推理行为,并将一个被诊断的停滞从数值猜测转向精确符号执行。综上,J64 使潜在过程状态可读,而路由使其可部署、可操作。

超越轨迹:将可解释的推理状态读出与原生 MoE 路由耦合:论文配图
图6:瞬时 routing→J64 映射(token 级版本)的跨 effort 迁移:在一个 effort 设定下训练该映射、在另一设定下测试,重建相关性最多损失 0.04。