论文
以低秩激活学习可组合的冻结语言模型决策算子
Learning to Decide, Not to Reason: Parameter-Efficient Decision Operators via Low-Rank Activation Steering
摘要
目前,将技能注入冻结的语言模型需要花费 100 万参数和一个强化学习管道。我们引入了 \method{},这是一种通过行为克隆训练的 System-1 决策运算符,可将成本降低大约两个数量级。默认算子使用 330K 参数来匹配经过强化学习训练的 1.33M-参数算子,超越或达到可比的性能,同时将 3,685-token 审议折叠为 6-token 决策,而不会损失准确性。具有 23K 参数的 4 级变体,是最强的已发布技能运算符的 1/58,足以满足 SearchQA 的需要,并且几乎足以满足 LiveMath 的需要,更高的等级仍然有帮助;相同的配方在五个任务和三个 骨干模型 之间转移,在训练几个月后发布的 LiveMath 问题上,分布外增益仍然存在。与之前工作的差距在于可训练性,它是由初始化和架构共同设置的:先前算子的初始化在第一个优化步骤中将两个大因子矩阵的梯度归零,而共享低秩骨干模型 内的零初始化输出投影立即收到梯度,梯度流 探针 直接确认了这一点。增益并不是思想链压缩:57 个 LiveMath 点中的 23 个点击败了基本模型的 8 中最佳采样,并且 Logit 透镜 探针 显示操作符沿模型现有的后层路径放大了答案,而不是提前写入。增益跟踪 13 个基本任务对中基本模型的余量,技能由近似线性运算符组成,可以在推理时添加、插值和热交换。 https://github.com/rlisml/decisionsteer. 上的代码
