论文
UniScale:通过模型路由与测试时扩展在线联合优化的自适应统一推理扩展
UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling
摘要
在大语言模型(LLM)的真实部署中,平衡推理质量与计算成本已成为核心挑战。现有方法沿两个大体独立的维度处理这一权衡:模型路由(在不同规模的模型间切换以匹配请求复杂度)与测试时扩展(TTS,在固定模型内调整推理时计算以实现细粒度控制)。然而,这种解耦设计带来了固有限制。由于模型规模集合稀疏,模型路由只能带来粗粒度、离散的性能变化;而单模型TTS常遭遇能力上限,并随计算量增加呈现收益递减。此外,将两种机制分开处理限制了在动态推理环境中的适应能力。为克服这些限制,我们提出统一推理扩展(UIS),将模型路由与TTS统一到单一优化空间中。基于这一形式化,我们提出UniScale,一个在线框架,将自适应UIS建模为上下文多臂老虎机问题,并通过LinUCB学习推理策略。该框架引入效率感知学习与成本建模,以确保在高维动作空间上稳定且可扩展的优化。评估表明,UniScale有效利用UIS空间中的协同效应,在多样、动态的推理场景中提供细粒度且持续更优的质量-成本权衡。
