论文

不要猜测,只需询问:通过多轮澄清解决引用细分中的歧义

Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification

模型训练强化学习

摘要

参考分割旨在基于文本查询来分割图像或视频中的目标对象。尽管过去几年取得了显着的进步,但现有的工作总是假设用户提供的查询已经是精确和清晰的。然而,这个假设是不切实际的。在现实场景中,期望所有用户彻底检查他们的视觉内容并仔细确保他们的查询是唯一且明确的是不现实的。当遇到这种情况时,现有的细分模型往往会任意猜测用户的偏好,往往会导致不期望的结果。为了解决这个限制,我们提出了 IC-Seg,这是一种新颖的代理框架,可以在分段之前通过多轮对话主动阐明用户意图。为了有效地激励这种能力,我们进一步引入了 Hi-GRPO,这是一种新的分层优化策略,可以在轨迹、转弯和步骤级别注入密集且信息丰富的监督信号。该策略鼓励有效的意图澄清,有效消除冗余交互并提高整体对话质量。为了进行评估,我们建立了 Ambi-RVOS,这是一个具有模糊用户查询的参考视频对象分割基准。大量实验表明,IC-Seg 不仅在解决模糊查询方面远远优于现有方法,而且在标准推理分割基准上保持了最先进的性能。代码和数据将在https://github.com/iSEE-Laboratory/IC-Seg发布。