论文
DepthCharge:用于测量 大语言模型 中深度相关知识的领域无关框架
DepthCharge: A Domain-Agnostic Framework for Measuring Depth-Dependent Knowledge in Large Language Models
摘要
大语言模型 在回答一般性问题时显得很有能力,但在回答特定领域的细节时往往会失败。现有的方法还没有提供开箱即用的解决方案来衡量 LLM 在跨任意领域的自适应后续提问下维持准确响应的深度。我们提出了 DepthCharge,一个与领域无关的框架,它通过三项创新来衡量知识深度:自适应探测,根据模型实际提到的概念生成后续问题,来自权威来源的按需事实验证,以及在每个深度级别具有恒定样本量的生存统计。该框架可以部署在任何具有可公开验证事实的知识领域,无需预先构建的测试集或特定领域的专业知识。 DepthCharge 结果与用于答案检查的评估器模型相关,使该框架成为比较评估而不是绝对准确性认证的工具。使用五个前沿模型在四个不同领域(医学、宪法、古罗马和量子计算)进行的实证验证表明,DepthCharge 揭示了标准基准所隐藏的与深度相关的性能变化。模型-域组合的预期有效深度 (EVD) 范围从 3.45 到 7.55,模型排名因域而异,没有一个模型主导所有领域。成本性能分析进一步表明,昂贵的模型并不总是能够获得更深入的知识,这表明特定领域的评估比专业应用中模型选择的总体基准更具信息性。