论文
Qworld:LLM 的特定问题评估标准
Qworld: Question-Specific Evaluation Criteria for LLMs
摘要
在开放式问题上评估 大语言模型 (LLM) 很困难,因为响应质量取决于问题的上下文。二进制分数和静态评分标准无法捕获这些依赖于上下文的要求。现有方法在数据集级别定义标准或在单次传递中生成它们,这限制了它们探索每个问题所隐含的评估空间的能力。我们引入一个问题一个世界(Qworld),这是一种使用递归扩展树生成特定于问题的评估标准的方法。给定一个问题,Qworld 通过分层和水平扩展将其分解为场景、视角和细粒度的二元标准。由此产生的标准指定了高质量答案必须解决该问题的哪些内容。在 HealthBench 上,Qworld 涵盖了 89% 的专家编写标准,并生成了 79% 经人类专家验证的新颖标准。专家们对 Qworld 标准的评价在洞察力和粒度上比以前方法产生的标准更高。当应用于 HealthBench 和 Humanity's Last Exam 上的 11 个前沿 LLM 时,Qworld 揭示了粗略标准无法捕捉到的长期影响、公平性、错误处理和跨学科推理等维度的能力差异。通过为每个问题生成评估标准,Qworld 可以评估针对问题量身定制的 LLM 回答,而不是基于固定的任务级别标准。