论文

超越准确性:大语言模型 中统计推理的多维评估

Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models

模型评测模型能力评测

摘要

统计推理具有多个维度,但大语言模型评测通常强调回答准确率,忽略模型如何组织和表达统计解释。本文结合答案准确率、回答行为、结构主题模型和词汇相似性分析,展示多维评估的价值。研究用这一框架分析15个当前一代LLM对90道题生成的解释;题目来自四套统计考试,覆盖高中、本科和研究生层次。不同模型的准确率差异较大,范围为55%至78%。结构主题模型则显示,各模型统计推理的概念组织方式具有共性。词汇相似性分析发现,厂商之间的解释风格存在幅度不大但一致的差异:同一厂商(如Anthropic或OpenAI)的模型,其解释比不同厂商模型略更相似。结果表明,仅准确率不足以描述当前LLM的统计推理;结合回答行为和模型解释的分析,可以形成更全面的评估。