论文
哪个 LLM 适合哪个工作?评估不确定下的预算模型分配
Which LLM for Which Work? Budgeted Model Allocation under Uncertain Evaluation
摘要
具有固定人工智能 (AI) 预算的公司必须决定由哪个 大语言模型 (LLM) 处理每个重复工作负载。它缺少的是质量表,即每个模型在每个工作负载上的表现如何。给定该表,该决策是一个多项选择背包问题,并且是常规解决方案,因此估计它是困难的,并且该估计在两个方面失败。模型很少在同一工作上进行比较,记录的分数通常是一个代理,而不是公司重视的结果。因果方法和 离策略 方法修复第一个,但对第二个提出条件,而评估者验证方法估计第二个,但没有做出决定。更糟糕的是,购买更多的重新评估并不能解决第二个问题:随机化决定对哪些请求进行评分,而不是如何产生分数,因此无论购买多少评估,该表仍然不确定。然而,即使表没有确定,部署决策仍然可以确定。因此,我们询问一项作业是否在与证据一致的每个质量表中保持最佳状态。对于固定预算问题,这承认精确的两次求解证书:一次在估计表上求解,一次在最不有利的表上求解。协议证明转让;分歧确定了模型-工作负载对,其中进一步的证据可能很重要。我们提出了 CASE(因果主动序贯实验),其目标是对这些配对进行评估,并随着证据的积累而重复测试。在生产日志上,测量失败是两者中较大的一个:准确地纠正分配仍然会留下大部分损失,而随机重新评估并不能消除它。在我们的实验中,可用的证据通常并不能决定任务。在付费软件任务中,关于模型质量的更好信息比在相同估计上进一步优化分配可以节省更多成本。