论文

STAVE:以两个向量替代上下文示例

Two Vectors Replace In-Context Demos: Structured Task Adaptation via Embeddings

模型训练参数高效训练

摘要

上下文学习 (ICL) 使冻结的大型多模态模型 (LMM) 适应一些演示 (demos) 中的新任务,但在每次查询时重新编码它们,其中每个演示图像总计达数百个视觉 token。无演示方法通过紧凑的任务状态消除了这种成本。然而,他们将其添加到每个任务搜索的位置或每个解码器层,其中任务参数随着深度而增长。此外,插入的 token 或键不能改变原始提示在层内分配注意力的方式。为了解决这些问题,我们提出了通过嵌入进行结构化任务适应(STAVE),它将演示替换为添加到现有输入嵌入的两个特定于任务的向量。具体来说,读出 向量更新产生答案的 token,上下文向量更新其他结构 token 组。两者都经过带或不带演示的提示上的答案标签训练。我们使用损失和裕度界限的一阶分析从理论上证明了这些设计选择的合理性。对 6 个 LMM 和 5 个大语言模型进行的大量实验表明,STAVE 在任务参数少得多的多模态任务上匹配或优于最先进的方法,并在 18 个文本任务上超越 15 镜头 ICL 和先验任务向量,所有这些都是零镜头推理成本。

STAVE:以两个向量替代上下文示例:论文原图
图 3:多模式设置中提议的框架 STAVE 的图示。