论文

路径锁专家:通过架构级分离分离混合思维中的推理模式

Path-Lock Expert: Separating Reasoning Mode in Hybrid Thinking via Architecture-Level Separation

摘要

混合思维语言模型公开了显式的 /think 和 /no_think 模式,但当前的设计并没有将它们完全分开。即使在 /no_think 模式下,模型也经常发出长且自我反思的响应,导致推理泄漏。现有的工作通过更好的数据管理和多阶段训练减少了这个问题,但泄漏仍然存在,因为两种模式仍然用相同的前馈参数进行编码。我们提出了 Path-Lock Expert (PLE),这是一种架构级解决方案,用两个语义锁定专家(一个用于 /think,一个用于 /no_think)取代每个解码器层中的单个 MLP,同时保持注意力、嵌入、规范化和语言模型头共享。确定性控制词元路由器为整个序列准确选择一条专家路径,因此推理保留了密集模型的每个词元计算模式,并且每个专家在受监督的 微调 期间接收模式纯更新。在数学和科学推理基准测试中,PLE 保持了强大的 /think 性能,同时产生了更强的模式分离、具有更高准确性和更少推理泄漏的 /no_think 模式。例如,在 Qwen3-4B 上,与 AIME24 上的仅 SFT 基线相比,PLE 生成的反射标记少了 17 倍(每个答案 6.01 个标记 vs. 0.35 个标记),输出缩短了 2 倍(8665 个标记 vs. 4101 个标记),并将 /no_think 准确度从 35.33% 提高到 44.67%,同时保持 /think 模式性能(61.33% vs. 61.33%)。 60.00%)。这些结果表明,可控混合思维从根本上来说是一个架构问题,而分离特定于模式的前馈路径是一个简单而有效的解决方案。