论文

从代码到预测:NNGPT 中神经网络性能分类的 微调 LLM

From Code to Prediction: Fine-Tuning LLMs for Neural Network Performance Classification in NNGPT

模型训练监督微调与指令调优

摘要

自动机器学习 (AutoML) 框架越来越多地利用 大语言模型 (LLM) 来执行超参数优化和神经架构代码生成等任务。然而,当前基于 LLM 的方法侧重于生成输出,并通过训练生成的工件来评估它们。 LLM 是否可以学习推理跨数据集的神经网络性能仍有待探索。我们提出了一个集成到 NNGPT 框架中的分类任务,其中经过微调的 LLM 可以预测给定的神经网络架构在两个图像分类数据集中的哪一个上实现更高的准确度。该任务建立在 LEMUR 数据集的基础上,该数据集提供了具有可重复性能指标的标准化 PyTorch 实现。评估了三种难度不断增加的提示配置:标准化精度基线(一般达到 100%)、用数据集属性替换精度的元数据丰富提示,以及仅显示架构源代码和数据集名称的纯代码提示。使用经过 LoRA 微调的 DeepSeek-Coder-7B-Instruct,仅代码提示在 15 个周期内达到 80% 的峰值准确度,而元数据提示的峰值准确度为 70%。每个数据集分析揭示了互补的优势:元数据对于具有独特属性的数据集表现出色(CelebAGender 为 90.9%),但对于重叠特征则性能下降,而仅代码提示显示出更平衡的性能。与 DeepSeek-Coder1.3B 的比较证实模型容量会影响这种形式的架构推理。结果表明,LLM 可以进行微调,以根据神经网络代码预测跨数据集的适用性,这表明架构源代码比单独的数据集元数据包含更丰富的判别信号。