论文

贝叶斯优化能否有效地找到神经丛林中强大的单一专家?

Can Bayesian Optimization Efficiently Find a Strong Single Expert in Neural Thickets?

模型训练参数高效训练

摘要

无梯度 后训练 已成为 大语言模型 (LLM) 基于梯度优化的引人注目的替代方案,但现有方法仍然成本高昂。我们询问结构化搜索是否可以在适度的评估预算下识别出强大的单一专家。有证据表明有用的权重更新位于低维子空间,我们在权重空间的随机线性嵌入中应用贝叶斯优化。我们的方法不需要反向传播,并使用高斯过程代理来有效地指导候选评估。在 Qwen2.5-Instruct 模型从 0.5B 到 3B 参数的多个推理基准中,使用少五倍候选评估的贝叶斯优化匹配或超过了 RandOpt。这些结果表明,代理引导搜索可以大大降低无梯度 后训练 的评估成本,同时产生更强大的可部署单一专家。