论文
离散动作空间是小模型连续控制中GRPO收敛的前提条件
Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control
摘要
我们研究群体相对策略优化(GRPO)能否微调小语言模型来完成仿真四旋翼连续控制任务。在我们的基准中,对Qwen-0.5B做原始GRPO微调以执行25 Hz四旋翼速度控制,会坍缩到平凡的零动作:成功率为0%,熵在60步内从0.35降至0.03。两项消融——移除jerk惩罚项与移除指向预训练先验的KL锚定——各自都能阻止熵坍缩,但都不能使学习发生。当动作接口被替换为在PID预设上的五选一离散选择时,训练得以收敛。所得控制器沿训练时长描绘出一条平滑性-可靠性Pareto前沿;两个端点均有报告:64步时成功率为98.6%、jerk为0.656 m/s3;256步时成功率为100%、jerk为1.103 m/s3(在匹配速度上限下为0.796 m/s3)。该配方在三个预训练语言模型上进行了评估。作为参照,重新调参的经典基线(PID,Ki = 0.30,vmax = 2.5)以jerk 0.736 m/s3达到同样的100%成功率。使用Crazyflie 2.1动力学的高保真仿真揭示了悬停区域的训练分布差距。