论文
LLM即导师:面向不可验证RL的策略感知提示自适应
LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
摘要
面向不可验证指令遵循的强化学习日益依赖带任务专属量规的LLM裁判作奖励信号。近期方法在训练中自适应量规,但训练提示本身仍是静态的。这种静态导致提示难度与策略能力错位——当提示无法在rollout间引发质量差异时,裁判无法恢复有区分度的奖励。为此我们提出LLM-as-a-Tutor:把LLM的角色从裁判扩展为导师——单一模型既作考官成对比较rollout以检测无挑战性提示,又作生成器向其追加原子约束。这种只增设计使难度随策略能力单调上升,产生自校准的训练信号而无需外部难度日程。在三个复杂指令遵循基准上,方法持续超越策略无感知基线与既往自适应量规或重写提示的方法——提示自适应是非可验证RL中缺失的策略感知轴。
