论文
用于移动边缘计算中任务卸载的多轮推理 LLM
Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing
摘要
新兴的计算密集型应用程序对资源受限的移动设备提出了严格的延迟要求。移动边缘计算 (MEC) 通过任务卸载来应对这一挑战。然而,由于动态任务到达、时变通道以及服务器队列的时空耦合,设计有效的策略仍然很困难。传统的启发式方法缺乏适应性,而深度强化学习(DRL)的泛化能力和架构刚性有限,需要在网络拓扑发生变化时重新训练。尽管 大语言模型 (LLM) 提供语义推理功能,但标准监督式 微调 (SFT) 会产生短视策略,贪婪地最小化即时延迟,而不考虑长期系统演进。为了解决这些限制,我们提出了 COMLLM,这是一种生成框架,可以在 MEC 系统中实现有预见性的决策。 COMLLM 将组相对策略优化 (GRPO) 与前瞻协作仿真 (LACS) 机制集成在一起,该机制执行多步蒙特卡罗轨迹采样,同时联合建模服务器队列动态。通过将这些采样轨迹纳入奖励设计中,该框架捕获了当前决策对未来系统状态的长期影响。实验结果表明,COMLLM 实现了接近最优的延迟并提高了负载平衡的公平性。值得注意的是,它表现出零样本拓扑可扩展性,允许在小规模网络上训练的模型推广到更大的、看不见的拓扑,而无需重新训练,优于 SFT、DRL 和启发式基线。