论文

指令条件探索:非对称强化学习与自蒸馏

Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation

模型训练强化学习RLVR

摘要

强化学习已成为大语言模型后训练、提升能力的重要工具,但LLM动作空间的结构带来不同于经典强化学习的挑战,也影响探索。需要利用预训练LLM广泛知识与灵活性的办法,在训练时主动生成多样经验。我们提出指令条件探索ICE,在任务提示中加入多种不同指令之一,扩展尝试行为的覆盖。为配合ICE,我们提出Asymmetric-RL/SD,将强化学习与自蒸馏目标结合,把探索行为迁移到测试时不带这些附加指令的策略。相较DAPO训练,ICE与该目标在4K回答长度的数学推理任务上,使Qwen3-1.7B的留出pass@1相对提高5.0%,改进在更长8K上下文中仍存在。

指令条件探索:非对称强化学习与自蒸馏:论文配图
图2 :在1.7B/4k的训练期间, DAPO-200探头通过@ 1。曲线是每个方法n = 5n {=} 5个种子的平均值。