论文
流系统中事件触发的 LLM 调用的不确定性顺序决策规则
Uncertainty-Aware Sequential Decision Rules for Event-Triggered LLM Invocation in Streaming Systems
摘要
流式推理管道越来越多地将轻量级快速模型与 大语言模型 (LLM) 配对,以大量成本提供丰富的语义理解。何时调用 LLM 的核心问题只得到了有限的正式处理。我们将其视为基于风险的顺序停止问题,当观察历史记录中的风险函数超过阈值时,触发策略就会触发。在此框架内,我们证明了六个结果:排除触发抖动的最小事件间时间界限;通过平滑粘贴优化阈值策略;估计参数下的近似 SPRT 保证; O(sqrt(T log T)) 对于固定流的遗憾,在 C_T 变化点下扩展到 O(sqrt((C_T + 1) T log T));自适应阈值在线梯度下降的 O(1/sqrt(T)) 收敛;以及校准错误率转移不等式。几个经典的触发器系列,包括事件触发、最优停止、SPRT、CUSUM 和贝叶斯触发器,可以表示为该框架的特例。在具有实际 LLM 调用的涡轮风扇退化数据 (CMAPSS) 上,我们凭经验验证理论假设,消除风险函数设计,与包括 RouteLLM 型路由器和上下文强盗在内的六个基线进行比较,并分析成本敏感性和 LLM 故障模式。结果证实了亚线性后悔,所有原则性触发因素的 alpha < 1;高诊断质量,1600 个 LLM 诊断中有 92.9% 达到我们的评分标准下的证据一致性评分 >= 0.75;并且异常分数驱动的风险函数在帕累托 AUC 上大约主导了替代方案一个数量级。