论文
解释之前先进行屏幕检查:基于基准的 LLM 置信信号的便携式有效性协议
Screen Before You Interpret: A Portable Validity Protocol for Benchmark-Based LLM Confidence Signals
摘要
LLM 置信信号用于弃权、路由和安全关键决策。不存在用于在构建之前检查置信信号是否携带项目级信息的标准实践。我们将临床人格评估(PAI、MMPI-3)的有效性筛选原则转移为基于基准的 LLM 置信数据的便携式协议。该协议指定了三个核心指数(L、Fp、RBS)、一个结构指标(TRIN)和一个项目敏感性统计量,这些统计量是根据单个 2x2 列联表计算得出的。三级分类系统(无效、不确定、有效)借鉴了四种临床传统。在 524 个项目的 20 个前沿 LLM 上进行了验证,四个模型被分类为无效,两个模型被分类为不确定。有效剖面模型显示平均值 r = 0.18(15/16 显着)。无效轮廓模型显示平均值 r = -.20 (d = 2.48)。使用具有口头置信度的 MMLU 和来自 Yang 等人的外部数据对 18 个模型进行交叉基准验证。 (2024) 确认了跨基准和探针格式的屏幕传输。所有数据和代码:https://github.com/synthiumjp/validity-scaling-LLM