论文
LLM 可以预测未来吗?预测市场的 Brier 评分分析
Can LLMs Predict the Future? A Brier Score Analysis of Prediction Markets
摘要
我们研究模型升级是否可以改善预测市场问题的概率估计。我们的已解决市场预测 (RMF) 基准包含 9 个领域的 3,000 个已解决的二元问题,我们使用纯问题零样本协议评估了 6 个 Claude 和 Qwen 模型变体。我们相对于经验基础率预测器评估 Brier 分数,检查其墨菲分解,并通过配对差异比较模型,结果按事件类别和相对于训练截止的时间进行分层。在报告的截止后层中,四个 Claude 模型的 Brier 分数为 0.183-0.192,比基准利率参考提高了 0.024-0.033。 Qwen 32B 并没有显着优于该参考,尽管其配对的 Brier 比 7B 检查点低 0.024。评估的克劳德版本和等级升级没有产生显着的改进。跨事件类别的模型内差异超过了克劳德变体之间观察到的差异。这些结果说明了为什么预测分数应与简单的概率基线和问题构成一起解释:在此协议下,较新的版本或更高的模型层并不总是能产生更准确的概率。