论文
JOVE:资源感知LLM任务图的联合执行与验证
JOVE: Joint Execution and Verification for Resource-Aware LLM Task Graphs
摘要
复杂推理查询可分解为有向无环任务图并分发到异构LLM,以并行降低延迟并使小模型解复杂任务。但实践中LLM对给定子任务的适配性可能先验未知,仅执行也无法揭示输出正确性。我们提出JOVE——在线框架:联合分配执行LLM并选择中间输出做付费验证;验证异步运行并用于改进未来分配,系统须在当下执行支出与为日后学习之间平衡。我们研究在长期预算与每查询延迟约束下如何优化该权衡,其中LLM服务质量、调用成本与执行时间随机且初始未知。JOVE通过求解逐查询混合整数线性规划序列做执行与验证决策;在线学习基于验证反馈更新任务相关的LLM质量估计,信息增益奖励把学习价值纳入分配决策。在一组自然假设下,我们为JOVE建立次线性质量-学习遗憾。跨四个推理基准,JOVE相对标准推理基线取得有竞争力的准确率,同时把平均成本与延迟至少降低3.17倍。