论文

SCVIB:用于多轮个性化本地化的可编辑状态条件视觉实例绑定

SCVIB: Editable State-Conditioned Visual Instance Binding forMulti-Turn Personalized Localization

模型评测基准与评测资源

摘要

我们引入了可编辑的状态条件视觉实例绑定,这是一种多回合本地化设置,其中跨回合引入多个支持定义的实例,协议定义的状态事件确定最终目标。我们将此设置实例化为 SCVIB,其中包括 1,050 个手动验证的支持查询碱基对和 1,500 个片段,涵盖五个视觉域、三个难度级别和四个目标状态依赖性组。直接Seq-free推理仅达到60.13\% Joint@0.5,表明解析最终参考并不能确保有效使用相应的视觉证据进行查询端定位。我们通过 TT-VG(转换树视觉基础)解决了这一差距,它将目标状态转换树(TSTT)与视觉证据基础适应(VEGA)相结合。 TSTT 将可见交互编译为协议定义的事件,在版本化的目标状态上执行它们,并将最终查询引用解析为相应的支持证据。 VEGA 采用轨迹导出的相同实例对进行改编,使用视觉证据包对已解析实例执行支持条件视觉定位。 TT-VG达到70.27%Joint@0.5;在匹配的目标分辨率下,VEGA比最强的比较方法高出16.20分。相对于直接推理的收益在反新旧度和回滚方面最大,这需要路由到非最新或恢复的支持证据。总之,这些结果将 SCVIB 确立为受控测试平台,并强调有效使用查询端同实例本地化的解析支持证据作为多轮个性化本地化的核心挑战。