论文

相同企业文本,不同模型测量值

Same Text, Different Numbers: The Divergence of LLM-Based Measures

模型评测鲁棒性、公平性与可信度评测

摘要

研究人员越来越多地使用生成式大语言模型 (LLM) 将企业文本转换为经验变量。我们使用 13 种衡量标准(包括情绪、管理清晰度、不确定性、答案特异性以及气候和政治风险)来研究基于大语言模型的文本衡量标准对模型选择的不变程度。来自不同提供商的七个大语言模型根据这些构念对标准普尔 500 强公司的财报电话会议记录进行评分。跨模型排名相关性平均仅为 0.52,不同提供商之间常见的电话会议记录水平差异仅占总分变化的 34%。跨模型分歧并不能预测随后的分析师或市场分歧,这与模型特定的重要组成部分一致,而不是基础披露中常见的模糊性。模型选择显着影响下游推理,模型之间的系数大小、符号和统计显着性差异很大。对于大多数构念来说,跨提供者进行平均可以使电话会议记录排名更加稳定,但分数水平仍然对集成中包含的模型敏感。因此,LLM 生成的变量应被视为模型相关测量,并在提供者之间进行验证。

不同LLM提供商对同一企业文本评分的相关性,比较高一致与低一致构念。
图1(图注摘要):不同LLM提供商对同一企业文本评分的相关性,比较高一致与低一致构念。