论文

IRDS:通过验证器耦合稀疏自动编码器覆盖进行可解释的 RLVR 数据选择

IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage

模型训练合成数据

摘要

具有可验证奖励的强化学习(RLVR)已成为增强 LLM 推理的关键技术,但其数据效率低下仍然是一个主要瓶颈。现有方法仅部分解决了这个问题,每种方法至少缺少子集级覆盖、验证器信号使用或可解释性中的一个。为了解决这一差距,我们提出了 IRDS(可解释的 RLVR 数据选择),它在稀疏自动编码器(SAE)集群的基础上选择 RLVR 训练实例,因此选择本身可以根据可识别的问题主题进行审核。为了选择模型既失败又可以从中学习的实例,我们在 SAE 的基础上引入了验证者耦合的覆盖目标,并通过贪婪的对数行列式最大化来解决它。对三个指令调整模型和六个数学推理基准的实验表明,IRDS 实现了最高的总体精度,在两个 Qwen 模型上超过最强基线 +3.9/+4.0 pp,在 Llama-3.1-8B 上超过 +0.5 pp,同时运行成本比基于轨迹的基线便宜一个数量级。