论文
LLM 评估中的尾部形状估计很脆弱:诊断误报的协议
Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives
摘要
最近的工作促使 大语言模型 (LLM) 评估从基于均值的指标转向尾部感知指标,包括条件风险价值和奖励模型误差的尾部指数估计。我们询问规范的极值理论尾部指数参数(将尾部的重量与尾部质量的大小分开)是否在 LLM 评估中添加了平均值和标准尾部幅度统计之外的判别信息。我们预先注册了一份协议,涵盖任何积极尾部形状声明的可接受性、拟合优度、阈值稳定性和效应大小要求。该协议是本文的贡献;下面的实证研究展示了它的大门捕获了什么。该协议应用于两个结构不同的评分器家族下的标准 LLM 毒性评估设置,捕获了朴素分析可能会发布的三种不同的误报模式,并拒绝了两个评分器的标题尾部形状声明。我们得出的结论是,我们检查的 LLM 毒性评估设置中的尾部形状估计比最近的文献表明的更脆弱,并建议该协议作为类似设置中尾部指数声明的起点。