论文
学习可靠推理的成本
Learning the Cost of Reliable Inference
摘要
基准测试与路由平台日益充当连接大语言模型提供商与最终用户的中介。然而,这些平台上的提供商通常采用每token固定价格,使用户无法为其任务获得最具竞争力的价格。本工作中,我们设计了一个采购平台,其中每个任务的token价格由提供商竞争驱动,使用户能够在有质量保障的水平上获得有竞争力的定价。为此,平台通过逆向第二价格拍卖顺序路由查询,激励模型提供商真实报出其服务用户查询平均成本的最佳估计。在路由查询的过程中,平台学习每个提供商提供的质量,并逐步将查询路由给满足期望质量阈值的提供商中最具成本竞争力者。为验证设计,我们在热门数学推理与问答基准上,用来自Llama和Qwen家族的多个LLM进行实验。结果显示,平台上最具成本竞争力提供商的定价利润率差异显著——从10%到71%——取决于任务和质量阈值。这表明当前固定价格市场存在显著低效,并证明只要竞争性市场条件允许,我们的平台可帮助用户获得最大节省。