论文

LLM 在玩骰子方面有多可靠?

How reliable are LLMs when it comes to playing dice?

模型评测基准与评测资源

摘要

我们通过离散概率问题的受控基准测试研究来研究 大语言模型 的概率推理能力。我们构建了两个数据集,分别是一组标准练习和一组反直觉练习,旨在触发启发式推理,并评估了 8 个最先进的模型,每个模型都在有或没有思想链提示的情况下进行了测试。模型在标准问题上的平均准确度为 0.96,但在反直觉问题上的平均准确度仅为 0.59。我们进一步提供了词元偏差的经验证据:当规范公式被伪装的变体取代时,性能下降了 20% 以上。在提示中嵌入误导性建议会使性能降低高达 34%,没有任何模型能够幸免。总而言之,报告的研究结果表明,当前的 LLM 还不是真正的概率推理机,尽管它们在高级数学问题上取得了成功。