论文
LLM-引导运行时参数优化以实现节能模型推理
LLM-Guided Runtime Parameter Optimization for Energy-Efficient Model Inference
摘要
大语言模型 (LLM) 已成为许多现实工作流程中不可或缺的一部分。然而,LLM 消耗大量能源,这成为这些工具需求规模的一个大问题。随着 LLM 集成到不同的工作流程中,出现了不同的应用程序来应对这些工具运行推理的挑战。这就提出了另一个问题,即为这些服务选择运行时参数值,以最大限度地减少能耗。通常,这需要对应用程序或传统优化方法有深入的了解,这可能需要几天的时间才能找到最佳值。在这项工作中,我们创建了一个具有 LLM 辅助运行时参数优化的人机交互流程,以解决此问题。通过人为创建的特定反馈提示方法,基于聊天的 LLM 可以比传统搜索方法更快地迭代找到节能推理参数。 LLM 还可以根据不同的硬件设置定制其解决方案,并轻松考虑其他系统限制。与基线相比,增强的提示模板能够以平均 3.4 个提示收敛到阈值以下,基线平均收敛于 5.2 个提示,并且始终实现较低的每个标记的最终能量。增强的提示模板在收敛速度上也优于 Sobol 采样。