论文

NEX:用于无标签思维链选择与模型排序的神经元探索-利用评分

NEX: Neuron Explore-Exploit Scoring for Label-Free Chain-of-Thought Selection and Model Ranking

模型推理推理验证与自校正

摘要

大语言模型越来越多地将推理计算用于采样多条思维链或在合并检查点中搜索。这使得瓶颈从生成转向选择,而且往往缺乏对目标分布的监督。我们证明基于熵的探索代理指标与准确率呈倒U型关系,表明额外的探索可能变得冗余并引发过度思考。我们提出 NEX,一个白盒、无标签的无监督评分框架,将推理视为 E 阶段(探索)与 X 阶段(利用)的交替过程。NEX 从稀疏激活缓存中,将每个 token 新激活的 MLP 神经元出现的尖峰检测为 E 阶段,然后用一个带粘性的两状态隐马尔可夫模型(HMM)推断 E-X 阶段,并根据 E 阶段引入的神经元是否在随后的 X 区间中被复用来为其赋予贡献分。这些信号产生可解释的神经元权重与单一的 Good-Mass Fraction 分数,可在没有任务答案的情况下对候选响应与合并变体排序。在多个推理基准与 Qwen3 合并模型家族上,在一小部分无标注激活集上计算的 NEX 能预测下游准确率并识别更优变体;我们进一步用人工标注验证 E-X 信号,并通过“有效与冗余”神经元迁移提供因果证据。

NEX:用于无标签思维链选择与模型排序的神经元探索-利用评分
图2:NEX算法概览。左:通过sticky HMM计算新颖性斜率时间序列并进行E-X分割。中:在 E → \rightarrow X 循环中,通过新神经元复用、巩固(斜率下降)和强度门控推进进程。右:使用归一化权重对神经元评分,并通过神经元加权激活质量对响应评分。