论文

TTVS:通过测试时变分综合促进自我探索强化学习

TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis

模型训练合成数据

摘要

尽管由具有可验证奖励的强化学习 (RLVR) 驱动的大型推理模型 (LRM) 取得了重大进展,但这种范式从根本上仅限于专门或新颖的领域,在这些领域,此类监督的成本过高或不可用,这对测试时适应提出了关键挑战。虽然现有的测试时方法提供了潜在的解决方案,但它们受到从静态查询集学习的限制,存在过度拟合文本模式的风险。为了解决这一差距,我们引入了测试时变分综合(TTVS),这是一种新颖的框架,它使 LRM 能够通过动态增强来自未标记测试查询的训练流来进行自我进化。 TTVS 包含两个协同模块:(1)在线变分综合,它将静态测试查询转换为多样化、语义等效变体的动态流,强制模型学习底层问题逻辑而不是表面模式; (2) 测试时混合探索,平衡了合成变体中准确性驱动的探索与一致性驱动的探索。大量实验表明 TTVS 在八种模型架构中都具有卓越的性能。值得注意的是,由于仅使用未标记的测试时间数据,TTVS 不仅超越了其他测试时间适应方法,而且还优于在大量高质量标记数据上训练的最先进的基于监督强化学习的技术。