论文
MirrorBench:评估用户代理的人性化的可扩展框架
MirrorBench: An Extensible Framework to Evaluate User-Proxy Agents for Human-Likeness
摘要
大语言模型 (LLM) 越来越多地用作人类模拟器,用于评估会话系统和生成微调数据。然而,幼稚的“充当用户”提示通常会产生冗长、不切实际的话语,这强调了对所谓的用户代理进行原则性评估的必要性。我们提出了 MIRRORBENCH,这是一个可重复、可扩展的基准测试框架,它仅根据用户代理在不同的对话任务中产生类人用户话语的能力来评估用户代理,并与下游任务的成功明确解耦。 MIRRORBENCH 具有模块化执行引擎,具有类型化接口、元数据驱动的注册表、多后端支持、缓存和强大的可观察性。该系统支持可插入的用户代理、数据集、任务和指标,使研究人员能够在统一的、方差感知的工具下评估任意模拟器。我们包括三个词汇多样性指标(MATTR、YULE'S K 和 HD-D)和三个基于 LLM 判断的指标(GTEval、Pairwise Indistinguishability 和 Rubric-and-Reason)。在四个开放数据集中,MIRRORBENCH 产生方差感知结果,并揭示用户代理和真实人类用户之间的系统差距。该框架是开源的,包括一个简单的命令行界面,用于运行实验、管理配置和缓存以及生成报告。该框架可以通过 https://github.com/SAP/mirrorbench 访问。