论文
信号是上限:开放式调查文本中 LLM 预测经验评级的测量限制
The signal is the ceiling: Measurement limits of LLM-predicted experience ratings from open-ended survey text
摘要
较早的一篇论文(Hong、Potteiger 和 Zapata 2026)表明,未经优化的 GPT 4.1 提示可以根据开放式调查文本预测粉丝报告的体验评分,其概率在 67% 以内。本文测试了提示设计和模型选择对该性能的相对影响。我们在来自 5 个 MLB 球队的大约 10,000 份赛后调查中比较了四种配置:原始基线提示和适度定制的版本,与三种 GPT 模型(4.1、4.1-mini、5.2)交叉。即时定制使 GPT 4.1 的一致性在 +/-1 范围内增加了大约两个百分点(从 67% 到 69%)。最佳配置的两种模型交换都会降低性能:GPT 5.2 返回到基线,而 GPT 4.1-mini 则下降了六个百分点。这两个杠杆的组合与输入本身相比相形见绌:在可用的配置中,文本的语言特征比提示或模型的选择所影响的准确度变化超过一个数量级。天花板有两部分。一是模型读取文本的方式存在偏差,提示设计可以纠正这一点。另一个是粉丝所写的内容与他们实际决定的内容之间的差异,任何工程都无法弥补这一差异,因为缺失的信息并不在文本中。即时定制移至第一部分;模型选择的变化也不可靠。结果并不是“即时工程有一点帮助”,而是即时工程以一种特定的、可预测的方式提供帮助,就其所能达到的上限而言。