论文
Conv-to-Bench:通过代码任务中的用户辅助对话评估语言模型
Conv-to-Bench: Evaluating Language Models Via User-Assistant Dialogues In Code Tasks
摘要
大语言模型 (LLM) 的快速发展已经超越了传统评估基准的可扩展性,而传统评估基准仍然严重依赖于劳动密集型的专家管理。我们通过 Conv-to-Bench 解决了这个瓶颈,这是一个多阶段框架,可以自动将真实的多轮用户辅助对话转换为结构化的、可验证的需求清单。通过利用现实世界对话日志中发现的“指令演化”,我们的方法将碎片化的用户意图解构为统一的指令和二进制评估标准。应用于编程领域时,Conv-to-Bench 生成的评估集与 BigCodeBench 等人类编写的标准近乎完美地一致,实现了高达 $ρ$ = 1.000 的 Spearman 相关性,同时计算开销显着降低。 LLM 作为法官框架的验证进一步证实了其可靠性,主要评估者与经过人工验证的 真值 达成了实质性一致($κ$ = 0.705)。我们全面的消融研究表明,虽然多轮交互捕获了用户意图的迭代演变,但以指令为中心的提取提供了更强大的基础。最终,随着以用户为中心的人工智能应用程序不断多样化,Conv-to-Bench 提供了一个可扩展、经济高效的范例,用于维持高保真评估标准。