论文

UniDial-EvalKit:用于评估多方面对话能力的统一工具包

UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities

模型评测基准与评测资源

摘要

在多轮交互场景中对 大语言模型 (LLM) 和代理进行基准测试对于了解其实际功能至关重要。然而,现有的评估协议高度异构,在数据集格式、模型接口和评估流程方面存在显着差异,这严重阻碍了系统比较。在这项工作中,我们提出了 UniDial-EvalKit (UDE),这是一个用于评估交互式人工智能系统的统一评估工具包。 UDE的核心贡献在于其整体统一:它将异构数据格式标准化为通用模式,通过模块化架构简化复杂的评估管道,并在分层评分聚合下对齐指标计算。它还通过并行生成和评分支持高效的大规模评估,以及检查点恢复以消除冗余计算。利用 UDE,我们对不同的多维基准进行了广泛的评估。我们的实证分析表明,没有一个系统在所有基准测试中始终优于其他系统,而当前的记忆代理通常无法超越全上下文基线。进一步的分析强调了未来的几个方向,包括基准重复数据删除和更具适应性的内存架构。