论文

LLM即导师:面向不可验证RL的策略感知提示自适应

LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL

模型训练合成数据

摘要

面向不可验证指令遵循的强化学习日益依赖带任务专属量规的LLM裁判作奖励信号。近期方法在训练中自适应量规,但训练提示本身仍是静态的。这种静态导致提示难度与策略能力错位——当提示无法在rollout间引发质量差异时,裁判无法恢复有区分度的奖励。为此我们提出LLM-as-a-Tutor:把LLM的角色从裁判扩展为导师——单一模型既作考官成对比较rollout以检测无挑战性提示,又作生成器向其追加原子约束。这种只增设计使难度随策略能力单调上升,产生自校准的训练信号而无需外部难度日程。在三个复杂指令遵循基准上,方法持续超越策略无感知基线与既往自适应量规或重写提示的方法——提示自适应是非可验证RL中缺失的策略感知轴。

LLM即导师:面向不可验证RL的策略感知提示自适应:论文配图
图 1:LLM 作为导师的概述:当政策对提示的答案在质量上无法区分时,导师 LLM 会添加一个约束,使提示更具挑战性。 (左)静态 RL 训练语料库包含对当前策略没有挑战性且提供很少学习信号的提示。 (右)导师检查了两项政策的推出;如果它们的质量无法区分,它就会附加一个约束,将没有挑战性的提示变成具有挑战性的提示,并在新的推出中引起差异。