论文

SignalReasoner:评估3B模型在信号数学推理上的上限

SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning

模型训练强化学习RLVR

摘要

以监督思维链微调和可验证奖励强化学习进行的后训练,已大幅提升大语言模型(LLM)的数学推理能力。然而,这些方法在信号处理问题上的应用仍相对缺乏探索。本报告研究将Qwen2.5-3B-Base适配到WirelessMATHBench-XL中研究生级信号数学问题的强化微调策略,该基准是该领域数学推理的综合性基准。我们考察两种训练范式:(i)在WirelessMATHBench-XL上以可验证奖励直接进行强化学习(RL);(ii)先在蒸馏的无线领域思维链语料上做监督微调(SFT),再进行同样的领域专用RL阶段。在两种范式下,我们均对组相对策略优化(GRPO)、组序列策略优化(GSPO)和几何平均策略优化(GMPO)进行了基准对比。我们想评估领域感知的CoT SFT能否作为后续RL的有效初始化,以及GSPO或GMPO在稳定性或准确率上是否优于GRPO以胜任信号推理任务。我们的最佳模型总体准确率达到39.12%,相比未训练的Base模型(12.37%)提升超过三倍。

SignalReasoner:评估3B模型在信号数学推理上的上限:论文配图
图2:PPO 与 GRPO 架构比较,改编自 DeepSeek-R1 [7]。PPO 需要单独的评论家(critic)网络通过 GAE 进行优势估计,而 GRPO 通过对多个采样响应计算组相对优势,从而免除了评论家网络。