论文

UniICL:通过面向能力的分类法将统一多模式情境学习系统化

UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

上下文与知识上下文工程

摘要

上下文学习 (ICL) 可以从演示中快速适应任务,无需更新每个任务的参数,但对示例选择和格式保持高度敏感。在跨越理解和生成的统一多模态模型中,跨模态干扰和不同的认知需求加剧了这种敏感性。因此,情境学习效果通常是非单调的并且高度依赖于任务。为了诊断这些行为,我们引入了一个六级能力导向的分类法,该分类法将演示的功能作用从基本感知到高阶辨别进行分类。在这个认知框架的指导下,我们构建了 UniICL-760K,这是一个大型语料库,其中包含跨 15 个子任务的精选 8 个镜头上下文学习片段,以及用于严格、受控评估的 UniICL-Bench。我们表明,这种数据驱动的组装是我们收益的主要来源。作为补充的轻量级稳定器,我们还提出了上下文自适应原型调制器,这是一个即插即用的模块,可以进一步提高几次射击的稳定性。对 UniICL-Bench 的评估表明,我们的方法产生了极具竞争力的统一结果,在大多数理解的上下文学习任务上优于较大参数多模态 大语言模型 基线。数据和代码可在 https://github.com/xuyi Cheng-zju/UniICL 获取。