论文
条件视觉证据实用程序:冻结视觉语言编码器中的状态相关排名反转
Conditional Visual Evidence Utility: State-Dependent Rank Reversals in Frozen Vision-Language Encoders
摘要
静态重要性得分将视觉证据压缩为单个排名,但在观察到一个提示后,剩余证据的价值可能会发生变化。我们在受控组合视觉搜索中研究这种可能性,其中颜色、形状和纹理证据可以独立暴露,并在获取状态下测量它们的条件边际效用。在对 800 个场景进行的确认中,冻结的 OpenCLIP 和 SigLIP 表现出强大的与状态相关的排名反转,这些反转集中在旨在引发排序变化的候选重叠机制中,在两个证据积累结构和十个等效查询措辞中持续存在,并在查询场景混乱下崩溃为接近机会规模的行为。随后对 1,200 个场景进行的角色平衡后续行动轮换了最初强、冗余诱导和比较属性的抽象角色;尽管残留的属性身份效应仍然存在,但在所有 24 个角色排列、骨干和证据模式单元中,正负反转对比仍然为正。我们进一步区分了衡量的重新规划机会和前瞻性可预测性。匹配第一行动效用分析显示了对剩余证据进行重新排序的巨大机会,但使用基于后验或获得嵌入状态表示的轻量级预测器并没有建立获得状态信息相对于角色平衡基准上的合法静态控制的强大增量优势。总之,这些结果表明,在这种受控环境中,条件视觉证据效用可靠地依赖于状态,同时将变化效用的存在与更强有力的主张(即这些变化可以由学习的选择器前瞻性地预测)分开。