论文
LLM 对未见问题的评估:情境多维 IRT 模型
LLM Evaluation on Unseen Questions: Contextual Multidimensional IRT Model
摘要
对 大语言模型 (LLM) 的评估越来越需要在收集大量新注释之前预测模型在新问题或任务上的表现。这个问题具有挑战性,因为问题难度、场景和底层能力需求可能有很大差异。简单的回顾性平均值可能会混淆模型能力与项目特征。在本文中,我们研究了一种基于模型的评估框架,该框架将多维项目响应理论模型与问题上下文相结合,以预测 LLM 在未见过的问题上的表现。该框架通过潜在能力配置文件来表示 LLM,同时使用问题内容来告知项目特征,从而允许信息传输到先前观察到的项目之外。根据经验,我们发现,对于场景内评估,结合问题嵌入可以改进相对于无模型基线的预测,并且多维潜在结构比一维替代方案提供了更丰富的能力变化描述。同时,我们的结果揭示了一个重要的局限性,即普遍性并不一定转化为跨场景转换下的可靠预测。这些发现表明,情境感知心理测量模型是高效且可解释的 LLM 评估的一个有前途的方向,同时也强调跨场景泛化是一个核心的开放挑战。