论文
KGCE:以知识增强与双图评测检验跨平台教育Agent
KGCE: Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models
摘要
随着多模态大语言模型(MLM)在自主Agent中的快速应用,教育场景中的跨平台任务执行能力受到显著关注。然而,现有基准框架在支持教育语境下的跨平台任务方面仍存在明显不足,尤其在应对校园专用软件(如XiaoYa Intelligent Assistant、HuaShi XiaZi等)时,Agent常因缺乏对这些私有域软件结构细节的理解而效率显著下降。此外,当前评测方法严重依赖目标导向或轨迹匹配等粗粒度指标,难以捕捉Agent在复杂任务中的细致执行与效率。为解决这些问题,我们提出KGCE(面向多模态语言模型跨平台教育Agent基准评测的知识增强双图评测器),一个整合知识库增强与双图评测框架的新型基准平台。我们首先构建了包含104个教育相关任务的数据集,覆盖Windows、Android与跨平台协作任务。KGCE引入双图评测框架,将任务分解为多个子目标并验证其完成状态,提供细粒度评测指标。为克服现有Agent在私有域任务中的执行瓶颈,我们开发了整合校园专用软件专属知识库的增强Agent系统。代码见https://github.com/Kinginlife/KGCE。
