论文
压力测试高效负责任的人工智能评估:当计算节省改变基准结论时
Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions
摘要
高效的评估改变了用于支持有关模型行为的声明的协议,但很少测试在评估本身变得更便宜后这些声明是否保持稳定。我们通过在批处理、量化、基准降低及其组合的七个条件下评估 BBQ 和 BBQ-V 上的三个密集和专家混合模型,对负责任的 AI 基准测试中结论的稳健性进行压力测试。我们并没有将保留的聚合准确度视为足够,而是将准确度、偏差严重性和普遍性、推理质量、子组行为、子集成员稳定性、运行时间和测量的 GPU 能量与完整基准 BF16 基线进行比较。较大的批处理可将准确度保持在基线的 0.35 个百分点以内,并产生相对较小的子组变化,同时减少六个模型数据集设置中的五个的能量。 INT8 很大程度上保留了质量,但使用 1.79--4.26$\times$ 基线能量。 INT4 会导致更大的、依赖于模型和上下文的变化。降低的基准提供了最一致的节省,但非常小的子集对保留哪些项目更加敏感。因此,有效评估应被视为一种测量干预措施,必须根据基准旨在支持的结论来检查其有效性。我们的项目网站是 https://vectorinstitute.github.io/sustainable-rai-evaluation/,代码可在 https://github.com/VectorInstitute/sustainable-rai-evaluation 获取。