论文

QQJ:量化定性判断以实现可扩展且与人类对齐的生成式AI评估

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

模型评测评测方法与指标

摘要

生成式人工智能的快速发展暴露了现有评估方法的根本局限,尤其是在开放式、创造性和面向人类的任务上。传统自动指标依赖表层统计相似性,往往无法反映人类对质量的感知;而纯人工评估虽可靠,却成本高、主观且难以扩展。近来以大语言模型作为评估者的方法提升了可扩展性,但常常缺乏对人类定义的评估原则的显式依托,导致偏差和不一致。本文提出量化定性判断(QQJ),一个可扩展、以人为中心的评估框架,显式弥合人类判断与自动评估之间的鸿沟。QQJ将质量的定义与执行分离:评估锚定在专家设计的多维量规上,并使用小型高质量标注集校准大语言模型评估者以对齐专家推理。这一设计使评估在多样生成任务和模态上保持一致、可解释且可扩展。在文本和图像生成上的大量实验表明,QQJ与人类判断的对齐程度显著强于传统自动指标和不受约束的基于LLM的评估者。此外,QQJ在重复评估中表现出更高的稳定性,并在识别幻觉和意图不匹配等关键失败模式方面具备更优的诊断能力。这些结果表明,结构化定性判断可以在不牺牲可解释性或人类对齐的情况下规模化运作,使QQJ成为可靠评估现代生成式AI系统的实用基础。