论文
SABRE:一种在预算范围内选择分布外探测器的多代理方法
SABRE: A Multi-Agent Approach for Selecting Out-of-Distribution Detectors Under a Budget
摘要
视觉语言模型的事后分布外 (OOD) 检测假设在基准测试中选择的检测器在部署后保持可靠。我们证明这在跨域中会失败:在单个冻结编码器上,在一个域中领先的检测器可以在另一个域中反转,将分布内的输入评分为比真正的异常值更异常,并且最佳检测器会随着域的不同而变化,因此没有固定的选择始终是可靠的。我们引入了 SABRE(选择性代理预算可靠性集成),它用推理时的按制度选择来代替这种固定选择。三个语言模型代理在有界查询预算下对事后检测器库进行推理:选择器选择接下来要咨询的检测器,报告器整合每个输入的证据,分析师在部署域中保留的小标记样本上校准检测器可靠性,并且与测试数据不相交,对选择和聚合进行加权,而无需观察评分输入的标签。该库包括我们建议的四个多模态密度检测器。 SABRE 根据数据推断操作状态,在事先不知情的情况下跟踪每个域中最强的检测器,在传统检测器反转的情况下恢复可靠的检测,并在正常情况下收敛到该检测器。成分分析显示这些代理是互补的:报告者的反馈产生一致的增益,而分析师的校准对于反演具有决定性作用,排除了不可靠的检测器,以便聚合不再取消合理的检测器。由于没有固定的规则可以跨域信任,因此必须在部署时建立可靠性,而不是根据基准假设,而 SABER 表明这可以自动完成。