论文

ReForge:用经验证的LLM编辑让ABR算法永不完工

ReForge: Keeping ABR Algorithms Never Finished with Verified Large Language Model Edits

模型训练持续学习

摘要

为一个网络场景设计ABR算法需要工程师数月时间,而大语言模型现在能在数小时内完成这项工作,达到甚至超过手工设计。但无论哪种方式,设计只适配其诞生时可见的世界,在世界继续演进后失效。我们要问:ABR算法能否跟上世界的步伐,在每个场景到来时于几分钟内被重新设计,且每次改动都被证明对已服务的每个场景无害?本工作提出ReForge,一个适应持续变化场景的持续启发式学习框架。ReForge在循环中运行大语言模型(LLM):每一轮LLM读取当前设计的不足并提出一个小编辑,再对迄今服务过的每个网络做回放来裁决。具体而言,它编辑的是一页模糊规则,把每个决策路由到冻结的预训练策略池中的某一个。LLM仅凭测量数据写出第一页规则,然后自行持续改进:每轮读取当前规则的不足并提出一个小编辑,由对迄今服务过的每个网络的回放决定编辑是否落地。我们在按3G、4G再到5G逐个到来的九个真实网络族上评估ReForge。每次场景到来只需几次编辑,就把平均QoE从1.23提升到1.74,超过最佳单策略的1.66,达到oracle的94%,甚至修复了循环从未见过的网络族,其中一个从0.30升到0.80。所有代码、数据和实验记录将在清理后开源。

ReForge:用经验证的LLM编辑让ABR算法永不完工:论文配图
图1. ReForge 的框架。