论文

EgoPro-Bench:以自我为中心的视频流中个性化主动交互的基准测试

EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

模型评测基准与评测资源

摘要

现有的多模式 大语言模型 (MLLM) 主要仍然是被动式的,无法持续感知环境或主动帮助用户。虽然新兴的基准测试解决了主动性问题,但它们在很大程度上局限于警报场景,忽视了个性化背景,并且无法评估人机交互(HMI)的精确计时。在本文中,我们介绍了 EgoPro-Bench,这是一种基于流式自我中心视频来训练和评估主动交互能力的新颖基准;它包括评估集中的 2,400 个视频和训练集中的超过 12,000 个视频。与之前的作品不同,EgoPro-Bench 利用模拟用户配置文件来生成不同的用户意图,并构建跨 12 个不同领域的高保真 HMI 数据。随后,我们提出了专门的评估协议和指标,训练了针对流视频数据进行高效推理和低延迟交互的主动交互模型,并进行了全面的评估。此外,我们引入了交互遵循“短思维,更好交互”的原则,在意图识别之前分配有限的词元预算,从而增强交互性能。实验表明,EgoPro-Bench极大地增强了MLLM的意图理解能力,并能够准确识别HMI的适当时机,从而为下一代以用户为中心的主动交互代理奠定了坚实的基础。