论文

HalluClear:诊断、评估与缓解GUI智能体中的幻觉

HalluClear: Diagnosing, Evaluating and Mitigating Hallucinations in GUI Agents

智能体系统Agent任务评测

摘要

尽管GUI智能体的进展在很大程度上由工业规模训练驱动,但无依据的幻觉常在真实部署中引发级联失败。与一般VLM领域不同,GUI智能体领域缺乏一个专注于幻觉的工具套件,用于细粒度诊断、可靠评估与针对性缓解。为弥合这一空白,我们提出HalluClear,一个面向GUI智能体幻觉缓解的综合套件,作为计算密集型规模化的补充。HalluClear包含:(1)源于实证失败分析的GUI特有幻觉分类法;(2)经校准的三阶段评估工作流,通过专家标注的基准测试与集成可信度估计提升VLM-as-a-judge的可靠性;(3)基于闭环结构化推理的缓解方案,通过冷启动初始化实现轻量级持续后训练,对通用型与GUI专用型智能体均适用。在代表性智能体与公开基准上的实验表明,仅用本套件中的9K样本进行后训练即可显著减少幻觉,从而提升定位(grounding)与动作保真度,为稳健的GUI自动化提供了一条计算高效的路径。

HalluClear:诊断、评估与缓解GUI智能体中的幻觉:论文配图
图 1:HalluClear Suite 概述。 HalluClear 旨在提供诊断、评估和减轻 GUI 代理幻觉的全面解决方案。 (1)案例驱动的分类法通过自下而上的聚类和从离线数据集中抽象失败案例来构建,对不同的幻觉模式进行精确分类。 (2) 为了确保可信度,三阶段评估工作流程(左下)在测量前通过专家注释的 JQ-Bench 上的可信度评估来确定 VLM 评委的资格。 (3) 为了解决这些问题,缓解方案(右)在轻量级后训练期间采用了闭环 OODA 式推理模式。