论文

MechSparse:机制引导的稀疏 PEFT 选择是任务形状的

MechSparse: Mechanism-Guided Sparse PEFT Selection Is Task-Shaped

模型训练参数高效训练

摘要

机械可解释性可识别具有特定行为的头部和 MLP 块的稀疏子集。我们询问这样的因果信号是否可以比实践者已经使用的廉价启发法更有效地指导在何处放置小额 PEFT 预算。 \method{} 通过在干净/损坏的探针上标准化激活修补恢复来对注意力头和 MLP 块进行评分,并仅在选定的站点上训练 LoRA/QLoRA; \methodc{} 为小型层内联合子集添加有界信用。我们在三个单元中与 Ministral-8B/NF4 上的随机、幅度、激活范数和梯度/Fisher 进行比较:$b{=}0.25\%$ 和 $1.0\%$ 处的斯瓦希里语跨 JSON 信息提取 (IE),以及 $b{=}1.0\%$ 处的英语$\to$斯瓦希里语机器翻译 (MT)。因果选择器永远不会赢得主要指标。在标题 IE 单元(3 个种子,配对引导 CI 超过 $600$ 预测)上,\methodc{} 击败随机 $+0.079$ span+type F1 和梯度/Fisher $+0.174$,但落后激活范数 $0.028$,具有最小的交叉种子标准($\pm 0.003$)。在 MT 上,所有四个选择器都位于 $0.30$ BLEU 范围内,并且每个配对的 CI 都包含零。模式与跨度分解解释了 IE 差距:激活范数捕获严格的 JSON 例程,而因果分数跟踪内容敏感站点。我们提炼出初步诊断——当输出结构占主导地位时更喜欢激活规范,将因果选择器视为内容主导任务的假设——并发布掩码、分数、预测和评估文件以供直接重播。