论文

LLM真的能理解项目难度吗?使用 LLM 自动生成项目的影响

Can LLMs Really Understand Item Difficulty Levels? Implications for Automated Item Generation Using LLMs

模型评测模型能力评测

摘要

项目难度的估计在形成性评估和大规模高风险总结性评估中都起着关键作用。本研究探讨了 大语言模型 (LLM) 如何使用大规模阅读和写作测试中的项目来预测项目难度级别。该研究调查了多个 LLM 的各种提示策略和参数设置。 LLM 性能与仅编码器的语言模型和基于特征的监督机器学习模型进行了比较。温度为 0 的零样本 GPT-4.1 产生了最高的项目难度级别预测精度,二次加权 kappa (QWK) 为 0.578。然而,LLM 的预测精度低于 ConvBERT (QWK = 0.625),后者优于基于特征的最佳监督机器学习模型。进一步分析表明,所有 LLM 都难以标记硬物品;特别是,当前先进的 GPT-5.4 往往会低估项目难度级别。嵌入的降维表明,不同难度级别的项目嵌入混合在一起,这表明仅来自项目的语义信息可能不足以用于项目难度级别预测。研究结果表明,如果 LLM 无法理解经验数据所证明的项目难度级别,并且在自身能力提高时倾向于将大多数项目视为简单,那么在使用 LLM 生成具有目标难度级别的项目时应谨慎行事。