论文

胡话有用:提示空间扰动拓宽推理探索

Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration

模型训练强化学习RLVR

摘要

可验证奖励的强化学习,尤其是组相对策略优化(GRPO),显著推进了大语言模型(LLM)的推理能力。但在复杂任务中,GRPO常受「零优势问题」困扰:当某查询的所有采样rollout都失败时,相对优势坍塌为零,模型对这些题目失去有效训练信号,浪费训练数据与算力预算。简单增加这些题目的采样预算是常见补救,但静态采样策略天然限制推理探索,制约成功率。本文提出面向探索的Lorem扰动(LoPE):一个打破探索瓶颈的简单有效训练框架。我们主张:与任务无关的提示空间扰动足以移动模型输出分布,为难题解锁正交的推理通路。具体地,LoPE在重采样前向提示前置从Lorem Ipsum词表(伪拉丁占位文本)随机组装的序列。跨1.7B、4B与7B模型的实验显示,LoPE显著优于以原提示重采样。进一步分析显示其他低困惑度的拉丁系随机序列同样是有效扰动。

胡话有用:提示空间扰动拓宽推理探索:论文配图
图 1:LoPE 概述。在标准推出阶段,如果所有 GG 响应均失败,LoPE 会在提示符前添加一个随机 Lorem Ipsum 序列,并对 G′G^{\prime} 响应进行重新采样。成功的推理响应与原始失败的响应重新组合,形成大小为 GG 的混合批次,用于策略更新。