论文

GrowLoop:人类播种的自我进化对话评估

GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

模型评测评测方法与指标

摘要

随着大语言模型的快速发展,评估开放式对话中的人类相似度变得越来越重要。然而,人类相似性是人类直观感知的一种隐性知识,但其潜在标准却无法明确表述。人类的判断差异很大,对某些情况有强烈的一致意见,而对另一些情况则有合理的分歧。与此同时,人类判断背后的标准仍然是隐含的,没有为构建案例留下明确的基础。此外,所谓的人类相似性并不是静态的,而是随着模型能力和人类期望而变化。尽管专家编写的基准、奖励模型和自我进化基准等评估方法取得了进展,但没有一个方法能够同时解决所有这三个挑战。因此,我们提出了 GrowLoop,一种自我进化的对话评估系统,可以随着模型的进步和场景的变化而不断适应。从最小的人类种子注释开始,LLM 代理通过启发式学习迭代地提取和完善评估规则。当注释者趋同时,需要人类与人工智能达成一致,而当注释者分歧时,则仅期望合理性。此外,Rubric-Case协同进化机制可以实现持续进化。当评估目标发生变化时,新的人类种子就会相应地扩大系统的覆盖范围。当应用于开放式对话中的人类相似性评估时,以这些规则为指导的人工智能法官不仅大大优于与人类判断一致的现有方法,而且还发现了注释者忽视的问题。由此产生的基准有效地区分不同功能层的模型并揭示它们的不足之处,同时推广到新场景并随着模型的进展进行调整。我们的工作将基准测试范式从手动更新或难度扩展转变为全面、持续的自我进化。