论文
ProEval:用于生成式 AI 评估的主动故障发现和高效性能估计
ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation
摘要
由于推理缓慢、评估人员成本高昂以及模型和基准的快速增长,评估生成式 AI 模型变得越来越资源密集。我们提出了 ProEval,这是一种主动评估框架,利用迁移学习来有效评估性能并识别失败案例。 ProEval 采用预先训练的高斯过程 (GP) 作为性能评分函数的替代,将模型输入映射到错误或安全违规的严重程度等指标。通过将性能估计构建为贝叶斯求积 (BQ),将故障发现构建为超水平集采样,我们开发了不确定性感知决策策略,主动选择或综合信息丰富的输入进行测试。理论上,我们证明我们预先训练的基于 GP 的 BQ 估计器是无偏且有界的。根据经验,关于推理、安全对齐和分类基准的大量实验表明,ProEval 比竞争基准要高效得多。它需要减少 8-65 倍的样本才能实现 真值 1% 以内的估计,同时在更严格的评估预算下揭示更多样的失败案例。