论文

多模态智能体搜索的静默失败:诊断分类与跨裁判评估

Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation

智能体系统Agent任务评测

摘要

多模态智能体搜索系统日益依赖外部工具回答知识密集的视觉问题。但现有评估主要关注最终答案准确率,可能漏掉搜索轨迹中的失败。本工作把这类隐性可靠性问题研究为静默失败。我们引入六类分类:模态捷径、幻影落地、错误证据—正确答案、过度检索洗白、跨模态矛盾与出处幻觉。基于该分类,我们构建轨迹级诊断管线,在统一的ReAct式治控下同时评估答案正确性与证据落地质量。在四个前沿多模态模型的MMSearch-Plus轨迹上的实验显示:表面准确率持续高估真实的轨迹级正确性。我们进一步以跨裁判验证、空白图像压力测试与工具消融证明:静默失败是能力依赖的,且常常是转移而非消失。主页:https://github.com/DingWu1021/silent-failures-multimodal-agentic-search。

多模态智能体搜索的静默失败:诊断分类与跨裁判评估:论文配图
图 1. 多模态代理搜索中静默失败的分类。每个面板都呈现一种故障类别,并具有代表性的任务示例以及触发诊断标签的观察到的行为。