论文
EARL:面向以自我为中心的交互推理和像素基础的统一分析引导强化学习框架
EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding
摘要
从以自我为中心的视觉中理解人类与环境的交互对于辅助机器人和嵌入式智能代理至关重要,但现有的多模态 大语言模型 (MLLM) 仍然难以实现准确的交互推理和细粒度的像素像素定位。为此,本文介绍了 EARL,一种以自我为中心的分析引导的强化学习框架,该框架将粗略的交互语义显式地转移到面向查询的回答和基础。具体来说,EARL采用了粗粒度解释和细粒度响应的两阶段解析框架。第一阶段整体解释以自我为中心的交互并生成结构化的文本描述。第二阶段生成文本答案和像素级掩码以响应用户查询。为了连接这两个阶段,我们提取了一个全局交互描述符作为语义先验,它通过一种新颖的分析引导特征合成器(AFS)进行集成,以进行面向查询的推理。为了优化异构输出,包括文本答案、边界框和像素定位掩模,我们设计了多方面的奖励函数并使用 GRPO 训练响应阶段。 Ego-IRGBench 上的实验表明,EARL 的像素像素定位达到了 65.48% 的 cIoU,比之前基于 RL 的方法高出 8.37%,而 EgoHOS 上的 OOD 像素定位结果表明对未见过的自我中心像素定位场景有很强的可移植性。