论文

从感受到指标:理解和形式化用户如何 Vibe-Test LLM

From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs

模型评测评测方法与指标

摘要

评估 LLM 具有挑战性,因为基准分数通常无法捕捉模型的实际用途。相反,用户经常依赖“氛围测试”:基于经验的非正式评估,例如比较与自己的工作流程相关的编码任务的模型。虽然振动测试很普遍,但通常过于临时和非结构化,无法大规模分析或重现。在这项工作中,我们研究振动测试在实践中如何工作,然后将其形式化以支持系统分析。我们首先分析两个实证资源:(1)用户评估实践调查,(2)来自博客和社交媒体的野外模型比较报告的集合。基于这些资源,我们将氛围测试正式化为一个由两部分组成的过程:用户个性化他们的测试内容以及他们判断响应的方式。然后,我们引入了一个概念验证评估流程,该流程遵循此公式,生成个性化提示并使用用户感知的主观标准比较模型输出。在编码基准的实验中,我们发现结合个性化提示和用户感知评估可以改变首选模型,反映了振动测试在实践中的作用。这些发现表明,形式化的氛围测试可以作为桥接基准分数和现实世界经验的有用方法。