论文
ContinuityBench:多提供商 LLM 路由中状态故障转移的基准和系统研究
ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing
摘要
在生产 大语言模型 (LLM) 部署中,高 API 可用性保证并不等同于对话连续性。当主要提供商遇到中断或严格的速率限制时,幼稚的无状态故障转移机制会成功维持正常运行时间,但会默默地丢弃对话历史记录,从而严重破坏用户体验。为了严格量化和解决这种故障模式,我们引入了两个新颖的指标:连续性保持率(CPR)和连续性延迟开销(CLO)。我们提出了一种有状态的多提供商代理架构,利用历史转发策略在故障转移事件期间跨异构 LLM 端点无缝重建会话状态。此外,我们还发布了Continuity-bench,https://github.com/Vishal-sys-code/Continity-bench,这是一个开放的评估工具,旨在对高并发提供程序故障条件下的上下文保留进行压力测试。我们的实证评估($N=750$ 故障转移事件)表明,我们的有状态代理实现了 99.20\% CPR [95\% CI: 98.27\%, 99.63\%],干净地将深层对话上下文传输到后备提供程序,而标准无状态架构的保留率接近 0\%。最后,我们描述了故障转移延迟分布的特征,确定了带抖动的异步指数退避的关键必要性,以防止针对严格限制回退 API 的级联重试风暴。我们的结果为构建强大的、状态保护的多模型推理系统提供了原则基础。