开源项目

AsgardBench:具身家务任务VLM评测

microsoft/AsgardBench

智能体系统Agent任务评测

概述

AsgardBench是微软发布的评测基准,用于评估视觉语言模型在具身家庭任务上的表现,重点考察最小反馈下的视觉定位交互规划能力,面向具身智能与VLM研究者。仓库1月28日创建,采用MIT许可,基于AI2-THOR提供任务环境、自动判定及完整评测命令,具备可复用的评测工程价值。3月的关联论文不改变当期首发范围,当期即提供可运行的基准评测路径。