论文

指令 蒸馏:作为视觉示例的文本指令

Instruction Distillation: Text Instructions as Visual Examples

上下文与知识上下文工程

摘要

具有多模态 大语言模型 (MLLM) 的视觉上下文学习 (ICL) 对于细粒度视觉分类非常有效,但每个检索到的图像示例都会消耗数百个上下文标记,使得大型 $K$ 设置在推理规模上过于昂贵。我们提出指令 蒸馏:一个离线程序,其中 MLLM 本身为每个单独的训练图像生成一个结构化识别指令,编码一般外观线索、区分该类与视觉相似类的特征以及常见的混淆点。与之前为每个类生成单一描述的工作不同,我们的指令是根据训练图像生成的,从而保留了每个类描述崩溃的类内视觉多样性。在推理时,我们研究了共享单个 CLIP 检索索引的五种配置:零样本、图像 ICL、仅指令 ICL 以及两种混合变体,其中检索到的邻居在图像和指令之间分割。在七个细粒度基准测试和两个 MLLM 主干中,基于指令的管道在 $K{=}1$ 时匹配或超过图像 ICL,并在 $K{=}5$ 时将每次查询词元减少 $2.9\times$,将推理延迟减少 $3.3\times$。混合配置进一步表明视觉和文本 ICL 信号是互补的,图像提供了学习和查看的视觉模式,而指令则提供了明确的规则和逻辑。当这两者都提供时,上下文的质量就会提高,这在性能中是显而易见的。