论文
潘多拉的AI模型路由盒:价值估计有代价时的高效分配
Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation
摘要
由多个模型、架构、运行框架或推理时设置构成的异构AI系统,可以通过把查询路由给能以最低成本最有效作答的专家模型,来提升质量与效率。路由需要估计每个专家模型的期望回报,但这种价值估计本身有成本。廉价的估计器(如基于嵌入的预测器)快但有噪声,而准确的估计器(如能利用检索结果或部分推理踪迹的微调模型)则代价高昂。我们把这一权衡形式化为“潘多拉之盒”问题的一个实例,即带有付费检查的最优搜索这一经典问题。在高斯信号模型下,所得策略具有闭式的信息价值表达式,可针对每个专家模型和每条输入判断细化价值估计是否值回其成本。我们把这一集中式策略称为Pandora's Router。我们进一步扩展到去中心化场景Pandora's Bidder,其中各专家模型独立决定是否先投资于自我评估、再接受给定报价以认领查询。在三个领域上的实验——一个标准的多LLM基准、检索增强的专家模型,以及具有可变推理时推理量的LLM——表明Pandora's Router的路由质量与穷举式估计相当,同时查询昂贵估计器的频率大幅降低。在去中心化场景中,当竞争性估计较为准确时,信息价值推理能提升分配效率;而当竞争性估计噪声较大时,它可能以牺牲其他参与者为代价提高策略性专家模型的效用。