论文
TuneAhead:在全面训练开始之前预测 微调 性能
TuneAhead: Predicting Fine-tuning Performance Before Full Training Begins
摘要
微调 大语言模型 (LLM) 是计算密集型且容易出错:模型性能敏感地取决于数据质量和超参数选择,幼稚的运行甚至会降低模型性能。这就提出了一个实际问题:我们可以在进行完整的训练之前预测 微调 的性能吗?我们提出了 TUNEAHEAD,一个用于 微调 性能事前预测的轻量级框架。 TUNEAHEAD 将每个候选运行编码为元特征向量,该向量将静态数据集描述符与来自短标准化探针的动态探针特征相结合。预测器将这些特征映射到性能估计,而基于 SHAP 的归因提供可解释的诊断,揭示哪些特定特征驱动预测。在 Qwen2.5-7B-Instruct 上运行的 1,300 多个 微调 中,TUNEAHEAD 的性能始终优于 Early-Stop Extrapolation 和 ProxyLM 等强大的基线。在 370 次运行的测试集上,TUNEAHEAD 的 RMSE 为 1.47 个百分点,并且 95.1% 的预测在真实分数的 +3/-3 个百分点范围内。这些准确的连续预测支持实用的通过/不通过筛选策略,可以减少不必要的完整 微调,同时保留最有希望的运行。