论文

MonitrLLM:以社区为中心的LLM评估基础设施

MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models

模型评测评测方法与指标

摘要

基准测试评估模型在受控任务上的能力;大规模对话数据集捕捉自然使用而不依赖用户反馈;在界面反馈机制记录满意度而不依赖任务目的。它们共同留下的关键差距在于现有的基础设施通常不常规地将交互轨迹与用户定义的目标和结果联系起来。我们引入MonitrLLM,这是一种开源基础设施,用于社区中心的LLM评估,它将完整的对话转录与用户报告的任务意图和结果评估联系起来,将所有三个视为主要评估信号,而不是可选的元数据。为了展示这种方法的价值,我们与26名大学生使用ChatGPT进行为期两周的可行性试点,收集了206份评估报告,其中包含完整的对话转录。我们的试点结果表明,将对话轨迹与用户报告的结果联系起来的价值。例如,尽管用户报告平均满意度为4.19/5,但参与者也报告了显著的23.1%的任务失败率。我们还发现,多轮对话报告失败率是单轮对话的2.5倍,这表明扩展的交互是困难的信号,而不是参与的信号。我们通过讨论将直接用户反馈与观察数据相结合,以进行稳健的LLM评估,以及实现这一目标的可能性。

MonitrLLM:以社区为中心的LLM评估基础设施:论文配图
图1 : MonitrLLM浏览器扩展,用户通过五个字段的表单提交审计报告,记录交互描述、任务目的、结果评估、对话共享链接和1对5的满意度评分。