论文

并行:一种受前额叶对齐强化启发的显式限制下语言模型学习方法

PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits

模型训练持续学习

摘要

最近的语言模型在各种任务中都取得了出色的性能,但传统的适应方法在训练样本中统一应用更新,而不管其本地更新的好处如何。我们提出了 PARALLEL,一种前额叶对齐强化启发的语言模型学习方法。受到目标相关和不确定性相关控制的互补作用的启发,PARALLEL 将这些形式的信息表示为单独的控制器信号,并将它们与当前模型表示相结合。受强化启发的控制器使用即时效用成本反馈来分配样本相关的更新强度。因此,PARALLEL 会学习何时以及如何强烈地适应每个样本,优先考虑有益的更新,同时限制不必要的参数更改。 PARALLEL 比选择性基线更有效地使用可用更新,同时保留 94.1--99.2% 的完全适应性能。除了多项选择推理之外,XSum 和 CNN/DailyMail 上的实验表明,PARALLEL 保留了完全适应获得的 ROUGE-1 和 ROUGE-2 分数的 96.9--98.6\% 以及相应 ROUGE-L 分数的 98.8--98.9\%。在相同的累积适应时间或 GPU 能量下进行比较时,在代表性运行中,PARALLEL 实现了更高的 ARC 精度,并表现出比 Full 适应更稳定的后期适应轨迹。这些结果表明,学习何时以及如何强烈地更新每个样本支持稳定且高效的部署后流适应,同时避免不必要的更新。