论文
VIABLE:VLM 作为法官评估的视障援助基准
VIABLE: A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
摘要
基于人工智能的视障援助 (VIA) 仍然具有挑战性,很大程度上是由于人工评估的成本高昂。 VLM 作为法官范式可能提供一个有前途的替代方案,尽管它主要在一般领域进行研究。因此,我们询问这些法官是否可以信任 VIA 的任务。为了研究这个问题,我们引入了 VIABLE(VLM 作为法官评估的视障援助基准),这是 VIA 中第一个 VLM 作为法官评估的基准。 VIABLE 包含跨越三种场景的超过 30 万个判断样本,并引入了具有 12 模式故障分类的有效性-公正性-稳定性框架。基于 VIABLE,我们对七名法官在不同模型尺度上的系统研究表明,现有模型在所有评估轴上基本上都不可靠。最强的判断器GPT-5.4,单次故障诊断准确率仅为52.6%,但自我偏好率最高,达到94.2%;而开源法官则具有强烈的偏见和对抗性的脆弱性。为了解决这些问题,我们提出了 VIA-Judge-Agent,这是一种与模型无关的推理时间工具,可以通过视觉证据提取和分类引导的工作流程来增强法官的能力。它可以积极提高诊断准确性和 BLV 用户更喜欢的下游 VIA 响应。数据和代码可参见:https://github.com/YiyiyiZhao/VIABLE