论文

超越路由权重:基于贡献对比的混合专家奖励模型忠实响应级解释

Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast

模型评测模型架构MoE模型行为与机制分析

摘要

奖励模型是从人类偏好中学习的核心,但识别驱动其预测的因素仍然具有挑战性。近期的稀疏混合专家(MoE)奖励模型试图通过将提示词路由到专门化专家、并以高路由权重样本刻画专家来提升可解释性。然而,路由权重只能揭示专家接收到哪些提示词,而不能揭示它如何评判响应,仅提供对专家行为的部分刻画。因此,我们提出CoCo(Contribution-Contrast)响应级解释方法,利用贡献对比最大的选择-拒绝响应对来忠实刻画专家的角色,同时捕捉路由行为与偏好行为。在自动与人工评估中,CoCo比基于路由器、基于分数与基于稀疏自编码器的替代方法产生更连贯、更忠实、更专门化的解释,同时保持有竞争力的奖励建模准确率。据我们所知,这是首个针对MoE奖励模型解释方法的系统性研究。