论文
SURGELLM:通过任务感知特征门控和类平衡标准化重新思考多任务评估
SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization
摘要
跨异构 NLP 任务部署的微调编码器面临三个复合问题:归纳偏差不匹配、特征统计的类不平衡损坏以及没有机制来调节对外部词汇知识的关注。我们引入了 \textbf{\surgellm},一个统一的 Transformer 框架,它使用专用的轻量级模块来解决每个问题:\emph{surgical feature gateway}(通过策划的词汇指示符和 \texttt{[CLS]} 学习每维 sigmoid;当特征信息不丰富时,可证明退化为恒等),\emph{task-conditioned prefix tokens}(量化特征值和任务身份)前置到每个输入)和 \emph{实例加权归一化}(IWN;从门统计中删除类先验偏差)。我们证明了连接门对\emph{手术特征对齐}的过度风险限制。在 SST-2、多跳检索、LLM 提示归因和作者身份检测这四项任务中,涵盖 17,830 个示例和三个种子上的 11 个模型变体,IWN 变体实现了宏 F1 \textbf{0.940} (在最强的非 IWN 基线上 +0.036$;在作者身份检测上 $+0.130$)。随机词汇控制($-0.028$ avg.\ F1)确认增益是词汇的,而不是参数的。代码、词汇表和 $99.5\%$-recovery 自动提取配方已发布。