论文
基于免奖励自微调智能体的自适应RAN切片控制
Adaptive RAN Slicing Control via Reward-Free Self-Finetuning Agents
摘要
将生成式AI模型集成到AI原生网络系统中,为实现自主自适应控制提供了变革性路径。然而此类模型在连续控制任务上的应用受制于固有的架构局限,包括有限上下文窗口、缺乏显式奖励信号以及长上下文的退化。本文认为,解锁稳健连续控制的关键在于让智能体把经验内化到参数中,而非依赖基于提示的记忆。为此,我们提出一种新颖的自微调框架,使智能体系统通过与环境的直接交互持续学习,无需手工设计奖励。该框架实现双视角反思机制,生成自主的语言反馈,从交互历史构建偏好数据集;随后的偏好微调过程把长程经验蒸馏到模型参数中。我们在动态无线接入网(RAN)切片任务上评估该方法——这是一个具有挑战性的多目标控制问题,需要在波动的网络条件下权衡频谱效率、服务质量与重配置稳定性。实验结果表明,该框架在样本效率、稳定性与多指标优化上超越标准强化学习(RL)基线和现有大语言模型(LLM)智能体。这些发现展示了自我改进生成式智能体在连续控制任务上的潜力,为未来AI原生网络基础设施铺路。