论文

通过凸重建和梯度缓存对 LLM 进行高效测试时微调

Efficient Test-Time Finetuning of LLMs via Convex Reconstruction and Gradient Caching

模型推理测试时计算扩展

摘要

测试时微调 (TTFT) 是一种快速发展的范例,它通过检索相关序列、更新模型,然后评估提示来使语言模型适应每个提示。然而,TTFT 只有在速度快时才实用:每个查询都会发生选择和微调,这使得每个查询都成为直接瓶颈。现有的方法以速度换取质量:快速检索通常是多余的,而更强的多样性感知选择则增加了令人望而却步的每次查询成本。我们引入 HullFT,这是一种解决这两个瓶颈的 TTFT 几何方法。给定一个查询,HullFT 首先使用高效的无投影 Frank-Wolfe 优化将查询嵌入表示为少数训练序列的稀疏凸组合。这产生了一个本质上相关且多样化的支持集。然后,我们将分数凸权重转换为精确的整数多重集,以便通过几何整数化过程进行微调。由此产生的多重性自然会产生重复的示例,我们利用梯度重用来在重复的微调步骤中分摊前向-后向计算。我们的实验表明,与当前最先进的 TTFT 方法相比,HullFT 改善了质量与效率的权衡,在显着降低的总运行时间下实现了更低的每字节比特数。