论文

ERQA-Plus:嵌入式人工智能推理的诊断基准

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

模型评测基准与评测资源

摘要

通才的具体主体需要的不仅仅是对象识别:它们必须推理空间关系、行动、程序、人类意图、环境限制以及来自情境视觉观察的常识性后果。然而,现有的视觉和具体化问答基准通常对所测试的推理依赖性提供有限的控制,使得很难将有场景依据的具身推理与快捷方式驱动的视觉或语言模式匹配区分开来。我们推出了 ERQA-Plus,这是一种用于具身人工智能推理的诊断基准。 ERQA-Plus 包含 1,766 个问答实例,这些实例以 711 个以机器人为中心的图像为基础,并根据涵盖感知、以行动为中心、社交互动、导航环境和上下文常识推理的结构化分类法进行组织。该数据集是使用多阶段生成和验证管道构建的,该管道结合了分类引导的问题生成、自动质量判断、迭代修订和人工评估,以提高视觉基础、答案有效性和推理质量。我们对代表性的通用视觉语言模型和体现模型进行了基准测试,包括 LLaVA-NeXT-8B、Prismatic-7B、MiniCPM-V-4.5-8B、Qwen3-VL、RoboRefer-8B 和 RoboBrain2.5-8B。尽管最强的模型 Qwen3-VL-32B 达到了 83.4% 的整体准确率和 61.4 SBERT 分数,但类别级别的结果揭示了空间推理、程序推理、事件预测和意图推理方面持续存在的弱点。因此,ERQA-Plus 提供了一个细粒度的评估框架,不仅可以衡量实体主体是否正确回答,还可以衡量它们能够和不能可靠地执行哪些形式的实体推理。该数据集位于 https://huggingface.co/datasets/huggingdas/erqa-plus,项目页面位于 https://github.com/LUNAProject22/erqa-plus。