论文

注意一切:统一人类注意力建模的基础模型

Attend to Anything: Foundation Model for Unified Human Attention Modeling

模型训练预训练

摘要

现有的人类注意力(显着性)建模方法在模式、场景和任务制定中仍然高度分散。因此,即使模型容量和数据规模不断增加,当前模型仍然主要依赖于场景和特定于任务,无法在实际应用中进行推广。为了解决基本限制,我们提出了 Attention to Anything Model (AAM),这是一种多模态基础模型,它统一了跨各种图像、视频和视听任务和场景的注意力建模。 AAM 将注意力重新表述为一种以从一般到特定的层次结构组织的认知蕴涵关系,通过语言提示在双曲空间中分层嵌入来实现。此外,为了统一静态图像和动态视频注意力,我们采用流体动力学视角,将视频帧注意力表述为受福克-普朗克方程控制的扩散时间演化。对 16 个基准进行的大量实验表明,AAM 在各种场景中始终优于最先进的方法,平均提高 6%,同时在视频推理方面实现约 4倍的加速。总的来说,这些结果表明 AAM 为未来关于注意力和显着性相关任务的研究提供了原则基础。数据集和代码可在 https://github.com/wz-zhao/Attend-to-Anything 获取。