论文

从静态到交互式:使视觉情境学习器适应用户驱动的任务

From Static to Interactive: Adapting Visual in-Context Learners for User-Driven Tasks

应用与实践内容创作

摘要

可视化上下文学习模型旨在通过利用一组示例输入输出对来适应新任务,从而无需特定于任务的 微调 即可实现快速泛化。然而,这些模型基本上以静态范式运行:虽然它们可以适应新任务,但它们缺乏任何机制来合并用户提供的指导信号(例如涂鸦、点击或边界框)来引导或完善预测过程。这种限制在现实世界的应用中尤其受到限制,用户希望主动引导模型预测,例如,通过突出显示目标对象进行分割、指示应在视觉上改变的区域,或隔离复杂场景中的特定人员以运行目标姿势估计。在这项工作中,我们提出了一种简单的方法,将静态视觉上下文学习器(特别是 DeLVM 方法)转换为高度可控的、用户驱动的系统,即交​​互式 DeLVM,通过自然视觉提示(如涂鸦、点击或绘图框)实现无缝交互。具体来说,通过将交互直接编码到示例输入输出对中,我们完整地保留了视觉上下文学习的理念:使用户能够在没有 微调 的情况下提示模型与未见过的交互,并使他们能够通过个性化交互动态引导模型预测。我们的实验表明,SOTA 视觉上下文学习模型无法有效利用交互线索,通常完全忽略用户指导。相比之下,我们的方法在可控、用户引导的场景中表现出色,在交互式分割方面实现了 $+7.95%$ IoU 的改进,在定向超分辨率方面实现了 $+2.46$ PSNR 的改进,在交互式对象去除方面实现了 $-3.14%$ LPIPS 的改进。通过这一点,我们的工作弥合了严格的静态任务适应和以用户为中心的视觉上下文学习的流畅交互之间的差距。