论文

用于理解以自我为中心的行为的注视规则化 VLM

Gaze-Regularized VLMs for Ego-Centric Behavior Understanding

模型训练监督微调与指令调优

摘要

眼睛凝视,包括注视和扫视,为人类意图和未来行动提供了重要的见解。这项研究引入了一个注视正规化框架,该框架增强了视觉语言模型(VLM)以实现自我中心行为理解。与仅依赖视觉数据并忽略注视信息的现有方法不同,我们的方法在训练期间直接将注视信息合并到 VLM 架构中。通过生成基于凝视的查询,模型动态地关注凝视突出显示的区域,而凝视正则化机制确保模型注意力与人类注意力模式的一致性。为了更好地了解如何将注视有效地集成到 VLM 中,我们进行了广泛的实验,探索合并注视数据的各种策略。这些创新可以通过详细的动作描述来预测未来事件。实验结果表明,与不利用注视数据的基线模型相比,语义分数提高了近 13%,这凸显了我们方法的有效性。这项工作为在 VLM 中利用人类凝视奠定了基础,显着提高了其在需要准确和稳健的未来事件预测的应用中的预测能力。