论文

从Model Choice到Model Belief:为基于LLM的研究确立一种新度量

From Model Choice to Model Belief: Establishing a New Measure for LLM-Based Research

模型评测评测方法与指标

摘要

大语言模型(LLM)越来越多地被用于模拟人类行为,但使用LLM生成数据的常见做法效率低下。把LLM的输出(“model choice”)当作单一数据点,未能充分利用LLM概率本性中固有的信息。本文引入并形式化“model belief”,一种由LLM的token级概率导出的度量,它在单次生成运行中刻画模型对备选项的信念分布。作者证明model belief渐近等价于model choice的均值(这是一个非平凡性质),但是一种统计上更高效的估计量,方差更低、收敛速度更快。对于下游应用中常用的model belief与model choice的平滑函数,类似性质同样成立。作者通过一个需求估计研究展示了model belief的性能,其中LLM模拟消费者对不同价格的反应。在运行次数有限的现实场景中,model belief对真实model choice的解释和预测优于model choice本身,并将达到足够准确估计所需的计算量降低约20倍。研究结果支持把model belief作为默认度量,以从LLM生成的数据中提取更多信息。