论文
见证证据组合:封闭式多模式答案的单次预填充风险检测
Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers
摘要
多模式 大语言模型 (MLLM) 的可靠部署需要决定是否应信任、审查可信的视觉答案或将其路由到更强大的系统。置信度分数捕获候选边缘,但不捕获与这些边缘相关的估计签名视觉读数的来源或它们的分布方式。我们使用产生答案的相同白盒预填充路径来研究封闭视觉答案的推理时间风险检测。见证证据组合 (WEP) 首先逐层估计哪些视觉贡献支持或与预测的候选者相矛盾。它通过两个可解释的途径系列总结了这些贡献:与问题相关的证据来源和签名证据集中。嵌套分组验证选择更可靠的族和稀疏的 top-k 路线组合,该组合与候选置信度融合。 WEP 不需要图像扰动、解码更改、向后传递或外部验证器。在三个 MLLM 和四个二进制答案基准测试中,WEP 将平均误差 AP 提高了 0.134。所有 12 个模型数据集增益均为正,并且图像簇自举间隔在 10 对上严格为正。 WEP 针对白盒封闭应答系统并使用带标签的校准切片。