论文

使用任务操作员捕捉情境学习动态

Capturing In-Context Learning Dynamics with Task Operators

模型推理推理加速

摘要

上下文学习 (ICL) 使语言模型能够通过演示执行新任务,而无需更新权重。然而,每个 ICL 推理都需要处理全套示例,导致部署效率低下,并且 ICL 的工作原理尚不完全清楚。先前的工作将 ICL 压缩为从特定层或位置提取的固定激活向量,但这些与输入无关的干预措施在输出依赖于与输入的细粒度交互的复杂任务上失败。通过分析 ICL 前向传递,我们表明每个注意力头的输出都是其上下文屏蔽对应项的仿射变换,并且该变换的参数在给定任务的样本中在经验上是稳定的。在此基础上,我们引入了任务运算符(TO),它将这种转换重播为对注意力输出投影的分析派生更新。在词汇、算法和推理任务中,TO 在现有方法中实现了最佳的整体性能,并大大缩小了零样本推理和 ICL 之间的差距。我们进一步表明,提取的知识集中在跨层和位置的特定于任务的稀疏电路中,并且对不相交演示批次中的算子进行平均可以在不扩展上下文窗口的情况下实现有效的多次缩放。我们的代码可在 https://github.com/gzxiong/task_operator. 获取