论文

GAR:通过约束优化实现LLM推理的碳感知路由

GAR: Carbon-Aware Routing for LLM Inference via Constrained Optimization

AI 基础设施模型网关

摘要

大语言模型(LLM)部署的不断增长,使得按请求路由对于在异构模型池之间平衡响应质量与计算成本变得至关重要。尽管电网碳强度随时间和地区变化,且各模型的能耗差异显著,现有路由方法却很少将可持续能源使用和CO2排放作为优化目标。为填补这一空白,我们提出Green-Aware Routing(GAR),一个约束多目标优化框架,在显式精度下限和p95延迟服务水平目标(SLO)约束下最小化每请求CO2排放。GAR通过按数据集调优下限实现自适应约束优化,并引入针对正确性、尾延迟和碳排放的轻量估计器,无需额外推理即可做出实时路由决策。我们提出GAR-PD,一种面向滚动碳预算的实用在线原始-对偶路由算法,同时还提出若干启发式变体,它们在限制精度损失的同时实现很高的可行性覆盖。在标准NLP基准与异构LLM池(7B-70B)上的全面实验表明,GAR在保持有竞争力的精度和p95延迟保障的同时实现了可观的碳减排,为可持续LLM推理提供了实用且有理论支撑的途径。

GAR:通过约束优化实现LLM推理的碳感知路由:论文配图
图 1:GAR 框架概述。 GAR 估算每个模型的质量、延迟和碳排放,并在准确性和延迟限制下选择碳排放最低的可行模型。