论文
我们何时需要LLM?面向语言驱动老虎机的诊断方法
When Do We Need LLMs? A Diagnostic for Language-Driven Bandits
摘要
我们研究上下文多臂老虎机(Contextual Multi-Armed Bandits,CMAB)在非情景式决策问题中的应用,此类问题的上下文同时包含文本与数值信息(例如推荐系统、动态投资组合调整、优惠选择,这些均是金融领域的常见问题)。尽管大语言模型(LLM)正日益被应用于这些场景,但在每个决策步骤都利用LLM进行推理的计算开销高昂,且不确定性估计难以获得。为解决这一问题,我们提出LLMP-UCB,一种通过重复推理从LLM中获取不确定性估计的老虎机算法。然而,我们的实验表明,基于文本嵌入(dense或Matryoshka嵌入)运行的轻量级数值型老虎机,能以LLM方案的一小部分成本达到相同甚至更高的准确率。我们进一步证明,嵌入维度是调节探索-利用平衡的实用杠杆,无需增加提示复杂度即可实现成本-性能权衡。最后,为给从业者提供指导,我们提出一种基于臂嵌入的几何诊断方法,用于判定何时应使用LLM驱动的推理、何时应使用轻量级数值型老虎机。我们的结果为低成本、不确定性感知的决策系统提供了一个有原则的部署框架,可广泛适用于各类AI应用场景。
