论文
J-Miner:将大模型分类器的决策逻辑压缩成可执行规则
J-Miner: Recovering the Decision Logic of Fine-Tuned LLM Classifiers as Compact Rules
摘要
任务微调的 大语言模型 (LLM) 分类器获取特定于任务的决策知识,但这些知识仍然隐含在分布式内部计算中,使其决策逻辑难以解释。我们引入了可执行决策压缩(EDC)框架并提出了 J-Miner,它从内部读数中挖掘词汇命名的变量,并学习跨输入共享的规则以生成可执行的解释。分析表明,一小部分变量捕获了分类器的大部分决策行为,适用于一个族和不同族内的不同参数尺度。在 6 个二元任务中,仅使用一个变量的规则平均重现了 76.7% 的源分类器决策,而使用 16 个变量时则上升到 88.8%。这些变量保留的大部分决策信息来自超出字面表面匹配的内部激活。轻量级文本阅读器预测变量状态,允许相同的固定规则独立于源分类器执行。