论文

BitRL:使用 1 位量化语言模型进行强化学习,用于资源受限的边缘部署

BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment

摘要

由于现代深度学习系统对内存、计算和能源的巨大需求,在资源受限的边缘设备上部署智能强化学习 (RL) 代理仍然是一项根本挑战。虽然 大语言模型 (LLM) 已成为决策代理的强大架构,但其数十亿的参数规模将其限制在基于云的部署,引发了对延迟、隐私和连接依赖性的担忧。我们介绍了 BitRL,这是一个使用 1 位量化语言模型构建 RL 代理的框架,可以在严格的资源限制下实现实用的设备上学习和推理。利用具有三元权重 (-1、0、+1) 的 BitNet b1.58 架构和优化的推理堆栈,BitRL 与全精度基准相比,内存减少了 10-16 倍,能效提高了 3-5 倍,同时在基准中保持了 85-98% 的任务性能。我们提供了作为结构化参数扰动的量化的理论分析,推导了冻结骨干架构下量化策略梯度的收敛界限,并确定了极端量化中的探索与稳定性权衡。我们的框架系统地将 1 位量化语言模型与边缘部署的强化学习集成在一起,并在商用硬件上展示了有效性。