论文
从洞见到行动:大语言模型中可解释性引导数据选择的新框架
From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models
摘要
尽管稀疏自编码器(Sparse Autoencoders, SAEs)等机制可解释性工具能够揭示大语言模型(LLM)内部有意义的特征,但把这些洞见转化为模型优化的实际行动仍存在关键缺口。我们以如下假设弥合这一缺口:由模型内部任务特征引导的数据选择是一种有效的训练策略。受此启发,我们提出可解释性引导数据选择(Interpretability-Guided Data Selection, IGDS)框架:先通过频率召回与干预式过滤识别这些因果任务特征,再选出能最大程度激活任务特征的“特征共振数据”(Feature-Resonant Data)用于微调。我们在Gemma-2、LLaMA-3.1与Qwen3模型上,于数学推理、摘要与翻译任务中验证IGDS。实验展现了出色的数据效率:在数学任务上,IGDS在Gemma-2-2B上仅用50%的数据便以17.4%的显著幅度超越全量数据微调,并优于已有的侧重数据质量与多样性的基线。分析证实特征放大与任务性能提升之间存在强正相关。IGDS由此提供了一个利用LLM内部机制来增强模型的直接而有效的框架,验证了我们的核心假设。
