论文

路由诱导的密度与稳定性(RIDE):路由式元提示对LLM内部状态的受控干预与机制分析

Route-Induced Density and Stability (RIDE): Controlled Intervention and Mechanism Analysis of Routing-Style Meta Prompts on LLM Internal States

模型评测模型行为与机制分析

摘要

路由被广泛用于扩展大语言模型,从混合专家(Mixture-of-Experts)门控到多模型/工具选择。一个普遍的看法是,将任务路由给“专家”会激活更稀疏的内部计算,从而产生更确定、更稳定的输出(即稀疏性-确定性假设)。我们在冻结的指令微调 LLM 输入前注入路由式元提示,作为路由信号的文本代理,以检验这一看法。我们量化了三个方面:(C1) 通过激活稀疏度衡量的内部密度,(C2) 领域关键词注意力,以及 (C3) 通过预测熵与语义变化衡量的输出稳定性。在包含三个指令微调模型(Qwen3-8B、Llama-3.1-8B-Instruct 与 Mistral-7B-Instruct-v0.2)的 RouterEval 子集上,元提示持续使早期/中层表征变得更稠密而非更稀疏;自然语言形式的专家指令往往强于结构化标签。注意力响应存在异质性:Qwen/Llama 降低关键词注意力,而 Mistral 则增强它。最后,稠密化与稳定性之间的关联很弱,且仅在 Qwen 中出现,在 Llama 与 Mistral 中相关性接近于零。我们将 RIDE 呈现为一个诊断探针,用于校准路由设计与不确定性估计。

路由诱导的密度与稳定性(RIDE):路由式元提示对LLM内部状态的受控干预与机制分析:论文配图
图1:多模型ΔHoyer在Early/Middle/Late层段的对比,考察路由式元提示对LLM内部状态的干预。