论文
PInVerify:活动实例验证的离线体现基准
PInVerify: An Offline Embodied Benchmark for Active Instance Verification
摘要
实体代理在导航到目标对象方面取得了长足的进步,但到达目标附近并不能保证代理找到了正确的实例:细微的属性差异(例如“白色花卉”与“白色条纹”)通常需要近距离、多视图检查。我们通过主动实例验证(AIV)来解决这一差距,在该任务中,代理主动选择围绕候选对象的视点,以决定它是否与细粒度的自然语言描述相匹配。我们将 AIV 形式化为有限范围决策过程,并引入 PInVerify,这是 AIV 的离线体现基准:跨 18 个对象类别的 3,000 个评估片段,以多视图捕获的形式提供,具有 6 扇区导航拓扑,可暴露陷阱视图(可导航但无信息)和无法到达的扇区。作为参考基线,我们围绕设备上规模的开源多模式 大语言模型 (MLLM)($\leq$8B 参数)构建了 无需训练 管道和 LoRA 微调的端到端代理,并具有属性分解、可见性加权多视图跟踪器和三个次佳视图 (NBV) 策略。在我们对 Qwen3-VL (4B/8B)、SenseNova-SI-1.2-InternVL3-8B、CLIP 和 SigLIP2 的评估中,基于 MLLM 的最佳基线超过最佳嵌入基线 4.9 个百分点; GT-box 消融显示 +3.1 pp 检测间隙;在测试的 NBV 策略中,我们没有观察到主动观点选择带来的可靠收益。 LoRA 微调代理 (SFT+GSPO) 达到 85.6%。 PInVerify 旨在支持具体人工智能中主动、细粒度语义验证的进一步工作。代码:https://github.com/Avalon-S/PInVerify。