论文

从凝视到文本的生成:超越人类注意力的分类解码

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

模型训练合成数据

摘要

我们引入了一个新的学习问题:将目光解码为跨不同视觉任务的人类目标的自然语言描述。与之前的工作将凝视解码视为对预定义类别的判别任务不同,我们将其表述为生成学习问题:训练模型以生成自由形式的描述,捕捉固定标签之外的人类意图的丰富细微差别和开放性本质。为此,我们引入了 Gazette,第一个凝视文本解码框架。基于多模态 大语言模型 (MLLM),Gazette 学习将注视扫描路径解码为自然语言,以实现可能超出分类标签并需要用自然语言表达的目标。为了帮助 Gazette 过滤掉凝视行为的个体差异,并学习对于生成准确的自然语言目标描述至关重要的特定目标时空动态,我们提出了一种新颖的策略,利用 大语言模型 的百科全书式知识和推理能力来合成目标导向注意力行为的自然语言解释,称为有声思考转录本。对这些合成叙述的指令调整使 Gazette 在跨多个任务的凝视解码中实现了最先进的性能,展示了其普遍性和多功能性,从而使凝视能够作为强大的、非侵入性的线索来推断不同场景中的人类目标和意图。