论文
选择中的测量:语言模型的诱饵校准失败审核
Measurement Under Selection: Decoy-Calibrated Failure Audits for Language Models
摘要
了解语言模型失败的频率并不能解释其错误集中在哪里。当审计师检查许多解释时,观察到的最强烈的模式可能会偶然出现。我们引入了 Janus,一个在报告错误模式之前检查建议错误模式的程序。 Janus 从正在评估的示例的是/否属性的固定列表开始,例如输入是否很长。对于每个属性,它会比较模型在具有该属性和不具有该属性的示例上的错误率。为了了解偶然会出现多大的差异,它会在跨示例打乱是/否标签后重复此计算,而不更改组大小。这些打乱的属性称为诱饵。仅当错误差异的大小满足使用诱饵设置的阈值时,才会报告该模式。在单独保留的示例中,同一组仍然必须具有较高的错误率,并且差异必须满足预先选择的最小值。在一项受控实验中,模型必须在包含人员、项目和续订代码表的文档中查找代码,Janus 确认了需要更多跨表查找的任务中错误率较高的五种相关模式。它还证实了第六种模式:在表格末尾提供所需信息的示例的错误率较低。在我们来自 MuSiQue 和 LongBench v2 公共基准测试的样本中,SliceLine 发现错误率较高的组,而 Janus 报告我们选择测试的示例属性没有确认的错误模式。为了进行比较,我们使用标准测试来整理错误并考虑测试许多候选者。通过相同的保留检查,他们根据测试和阈值确认两到六个受控模式,并且在任何一个基准上都没有确认。在没有真实错误模式的模拟中,Janus 比 Benjamini-Hochberg 更频繁地报告错误模式,具体取决于诱饵数量。