论文
通过元学习从隐式成本性能偏好中学习路由 LLM
Learning to Route LLMs from Implicit Cost-Performance Preferences via Meta-Learning
摘要
大语言模型 (LLM) 提出了性能和成本之间的权衡,其中更强大的模型会产生更大的费用。 LLM 路由旨在通过将查询发送到最合适的模型来减少开支,同时保持性能。然而,现有方法不能很好地适应不同用户的性价比偏好。为了解决这一差距,我们引入了一种新颖的感知 LLM 路由范例,用于个性化和以用户为中心的性价比优化,它通过很少的交互有效地学习用户的隐式偏好。为了应对异构用户需求的挑战,我们将偏好配置文件制定为上下文强盗中的一组不同任务,并提出 MetaRouter,这是一种专为偏好感知 LLM 路由而设计的元学习框架。实验结果表明,MetaRouter 在分布内和分布外任务上均优于强基线。此外,它在学习用户偏好方面表现出高效率、对可路由 LLM 变化的鲁棒性以及多模型路由的可扩展性。