论文
Ambient @ EgoProactive 2026:通过视觉监督提供主动的自我中心协助
Ambient @ EgoProactive 2026 : Proactive Egocentric Assistance with Visually Grounded Supervision
摘要
我们向 ECCV 2026 可穿戴人工智能挑战赛的 EgoProactive 赛道提交了我们的参赛作品,该赛道在大型模型组中排名第一,在 <=2B 组中排名第二。这项任务需要一个可穿戴助手在每八秒的以自我为中心的视频片段后决定是否进行干预或保持沉默。我们的方法有两个主要组成部分。首先,我们将干预时机重新表述为单标记分类。该模型不是生成 $interrupt$<utterance> 或 $silent$,而是预测是或否,并且我们从这两个标记的重新归一化概率中得出决策。与自由形式生成相比,该公式将 Macro-F1 提高了 0.249,将 G-mean 提高了 0.30。其次,由于标记数据仅限于已发布的验证集,因此我们使用工具调用视频代理生成额外的监督,该代理检查每个剪辑并分配干预时间戳。仅叙述的替代方案体积大四倍,成本低十倍,但转移效果比来自不相关的真实语料库的监督更差,这表明视觉基础比这项任务的注释量更重要。