论文
Opti-Q:面向多 LLM 问题规划的基于约束的优化框架
Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning
摘要
虽然大型语言模型(LLM)带来了强大的问答(QA)能力,但非确定性和异构的资源画像(成本、延迟和能耗)使预算受限的部署变得复杂。我们提出 OPTI-Q,一个受数据库启发的、基于成本的优化器,为多 LLM 编排实现「先计划后执行」范式。OPTI-Q 将 LLM 调用建模为执行 DAG 中的物理算子,并对每个问题搜索在用户指定资源约束下权衡财务成本、延迟和能耗、以优化答案质量(QoA)的计划。计划可以包括将中间答案作为上下文传递的顺序算子,以及并发运行模型并合并其输出的并行/混合算子。为在不实际执行每个候选计划的情况下搜索该空间,OPTI-Q 使用 PERFDB——一个从基准测试和执行轨迹填充并刷新的统计目录——来估计单个算子和组合子计划的 QoA 与资源成本。利用这些估计,OPTI-Q 执行帕累托前沿搜索,并根据用户偏好选择最终计划。在用户指定预算下的 MMLU-Pro 和 SimpleQA 上,OPTI-Q 在可比成本下将平均 QoA 较基线提升约58%和41%,表明数据库式规划为多 LLM 问答带来更优的质量-资源权衡。
