论文
没有标准答案时如何评测语言模型?借鉴陈述偏好经济学
Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models
摘要
现在对大型语言模型提出的许多问题都没有正确的答案来评分:策略的价值是什么,用户应该选择哪个选项,如何权衡竞争价值。规定偏好经济学几十年来一直面临这个问题。它在不知道真实价值的情况下,通过有效性框架和相关概念(内容、结构和标准有效性、可靠性、激励相容性和后果性)来判断调查响应。我们认为这个框架是评估语言模型的通用方法,并且我们阐述了每个概念对于LLM评估的含义。我们使用已发布的水质规定偏好经济评估调查(Vossler 等人,2023 年)对六个模型进行管理来演示该方法。在这个经济应用中,有效性检验采用经济理论预测的形式:需求应该下降,支付意愿应该对商品的范围和收入做出反应。测试将模型明显分开。两个较旧的模型在家庭收入水平为 75,000 美元时未能通过最基本的测试,而两个最新模型通过了我们可以得分的所有理论有效性测试,但在收敛有效性上存在分歧。通过有效性测试表明模型的答案是连贯的,而不是它们是正确的。
