论文
惊喜引导合并排序:通过自适应比较调度实现预算高效的人机循环排名
Surprise-Guided MergeSort: Budget-Efficient Human-in-the-Loop Ranking via Adaptive Comparison Scheduling
摘要
成对比较是主观排名任务的黄金标准;然而,详尽的注释需要大量的人工比较($O(n^2)$)。虽然基于排序的方法已将这种负担减少到 $O(n\log n)$,但它们仍然需要对每次比较进行昂贵的人工判断。为了进一步提高注释效率,我们建议利用视觉语言模型(VLM),而不是作为注释器的替代品,而是作为\emph{问题优先级排序器}来识别哪些比较真正需要人类判断。所提出的 Surprise-Guided MergeSort (SGS)} 框架通过三个集成组件实现了这一目标:(1) 一个自下而上的 MergeSort 调度程序,用于构建比较并利用传递性;(2) 一个复合 Surprise Scorer——结合了位置偏差取消的 VLM 置信度、Elo 差距和投票熵——以量化比较模糊性;(3) 一个自适应预算分配器,用于路由与人类进行高惊喜配对,同时通过传递性推理自动进行低惊喜配对。对涵盖文本相似性(STS-B、BIOSSES、SICKR-STS)和图像质量评估(KonIQ-10k、TID2013、LIVE Challenge)的六个不同基准进行了验证。 SGS 在每个会话中有效识别并跳过了多达 535 个无信息比较。因此,在相同的总预算下,它比 Active Elo 实现了 Kendall 的 $τ{\times}100$ 改进,从 $+6$ 到 $+12$。这些结果表明,将 VLM 引导的意外指标与算法排序相结合,可以在不同领域提供总体一致的准确性与效率权衡。