论文
用特征选择与核岭回归降低模型基准评测成本
Efficient Benchmarking Is Just Feature Selection and Multiple Regression
摘要
高效的基准测试技术旨在通过仅使用基准测试问题的子集来预测完整的基准测试分数,从而降低评估 LLM 的计算成本。通过将这个问题重新定义为具有特征选择的多重回归的实例,我们发现通过在预测阶段简单地使用核岭回归可以极大地改进现有的有效基准测试方法。此外,使用称为最小冗余最大相关性(mRMR)的信息论特征选择算法,我们可以通过选择对预测最有用的问题子集来进一步改进这些方法。除了在数据非常匮乏的环境中之外,这些方法在使用二进制和连续指标的一系列基准测试中始终实现了较小的预测误差(MAE 和 RMSE),以及预测分数和真实分数之间更大的排名相关性(Spearman $ρ$ 和 Kendall $τ$)。此外,mRMR 子采样比竞争对手的方法(通常涉及拟合概率模型或运行聚类算法)快得多,并且更有可能在不同的随机种子或训练数据分割下选择相同的问题。教程代码可以在 https://github.com/sambowyer/mrmr_eval 找到。