论文

评估 LLM 生成的偏好分布

Evaluating LLM-Generated Preference Distributions

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地用作概率生成器,用于在无法获得真实世界数据的情况下进行模拟、合成数据生成和决策支持。然而,它们生成的发行版的结构和可靠性仍未得到充分研究。在这里,我们系统地分析了大语言模型生成的航空旅行、餐厅和消费品的偏好分布。令人鼓舞的是,我们分析中考虑的所有模型都表现出自我一致性,最可能的结果在重复采样下迅速稳定。与此同时,我们观察到模型家庭和量表之间存在很大的不一致,即使在最可能的结果之间也几乎没有达成共识。这些模式适用于九个开放权重模型、三个选择域,并在温度变化、贪婪解码以及提示和排序扰动下表现出鲁棒性。我们的研究结果表明,结果更多地受到模型选择的影响,而不是提示措辞的影响,这挑战了一个普遍的假设,即足够有能力的大语言模型在用作调查受访者的替身时会产生类似的偏好分布。