论文

突破界限:渐进式 LLM 发展的统一自学框架

STRETCH the Boundaries: A Unified Self-Taught Framework for Progressive LLM Evolution

模型训练强化学习

摘要

大型语言模型(LLM)在自我提升训练中经常会遇到能力停滞的问题,因为固定的难度水平无法适应其不断发展的熟练程度。为了解决这个问题,我们提出了 STRETCH(通过目标挑战进行自学推理进化),这是一个受认知支架理论启发的统一框架。 STRETCH 引入了动态拉伸区域机制,不断将问题难度与模型的解决能力保持一致。在单个参数空间内,该模型在生成自适应、突破边界的挑战的支架和通过强化学习优化其解决轨迹的学习器之间交替。这种双环协同进化有效地稳定了训练,减少了奖励作弊行为并促进了渐进式推理的增长。谈判和运筹学基准的实验表明,STRETCH 始终优于强提示和特定领域的基准。进一步的脚手架配置分析表明,动态难度调整对于持续的能力改进和同步推理进化至关重要。