论文
衡量自然语言解释中的判断质量:预测锦标赛的证据
Measuring Judgment Quality in Natural-Language Explanations: Evidence from Forecasting Tournaments
摘要
决策者通常依赖专家判断并附有书面解释,但解释质量很难大规模衡量。预测锦标赛提供了一个天然的试验场:概率判断与自然语言原理相结合,并根据实现的结果进行评分。我们引入了解释质量标记 (EQM),这是一组由 大语言模型 (LLM) 评分的 60 个理论指导推理模式。在对多年预测锦标赛中超过 55,000 个预测理由对进行的预先注册分析中,EQM 在预测者和预测者级别上预测准确度,始终优于 LLM 之前的文本分析方法。超过 90% 的统计显着模式级 EQM 准确度相关性与我们的方向性假设相符。信号是不对称的:EQM 识别可能表现不佳的人比识别最好的预测者更可靠。以传统的预测技能指标为基准,EQM 是预测级别上最强的预测因子,并且在预测者级别上具有竞争力,尽管比之前的准确度要弱。人类对基本原理质量的评级与准确性的相关性较差,并且过分重视基本原理的长度。结果转移至独立预测研究。 EQM 提供了一种可扩展、可解释的方法,用于从书面解释中提取与判断相关的信息。