论文
胡话有用:提示空间扰动拓宽推理探索
Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration
摘要
可验证奖励的强化学习,尤其是组相对策略优化(GRPO),显著推进了大语言模型(LLM)的推理能力。但在复杂任务中,GRPO常受「零优势问题」困扰:当某查询的所有采样rollout都失败时,相对优势坍塌为零,模型对这些题目失去有效训练信号,浪费训练数据与算力预算。简单增加这些题目的采样预算是常见补救,但静态采样策略天然限制推理探索,制约成功率。本文提出面向探索的Lorem扰动(LoPE):一个打破探索瓶颈的简单有效训练框架。我们主张:与任务无关的提示空间扰动足以移动模型输出分布,为难题解锁正交的推理通路。具体地,LoPE在重采样前向提示前置从Lorem Ipsum词表(伪拉丁占位文本)随机组装的序列。跨1.7B、4B与7B模型的实验显示,LoPE显著优于以原提示重采样。进一步分析显示其他低困惑度的拉丁系随机序列同样是有效扰动。
