论文

巩固还是适应?PRISM:通过梯度集中度解耦SFT与RL数据

Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration

模型训练强化学习合成数据Agentic RL

摘要

虽然“监督微调(SFT)后接强化学习(RL)”的混合范式已成为训练LLM代理的标准流程,但这两个阶段之间有效的数据分配机制在很大程度上仍缺乏研究。当前的数据仲裁策略往往依赖表层启发式,无法诊断内在学习需求。由于SFT通过模仿实现模式巩固,而RL通过探索驱动结构适应,将数据与其功能角色错配会造成严重的优化干扰。我们提出PRISM,一个以图式理论(Schema Theory)为基础、依据数据与模型既有知识的认知冲突程度进行仲裁的动态感知框架。通过分析梯度的空间几何结构,PRISM将触发高空间集中度的数据识别为需要RL进行结构重构的高冲突信号;相反,产生分散更新的数据则被路由到SFT以进行高效巩固。在WebShop与ALFWorld上的大量实验表明,PRISM实现了Pareto改进,在超越最先进混合方法的同时将计算成本最多降低3.22倍。我们的发现表明,基于内部优化机制解耦数据,对可扩展且稳健的代理对齐至关重要。

巩固还是适应?PRISM:通过梯度集中度解耦SFT与RL数据
图2:PRISM 总览。该框架由三个阶段组成:(1) Non-Invasive Gradient Probing(非侵入式梯度探测):提取更新地貌(update landscapes)以捕捉模型对每个样本的内部反应;(2) Quantifying Structural Dissonance(量化结构失谐):测量梯度集中度以诊断数据与已有知识之间的冲突;(3) Distribution-Adaptive Routing(分布自适应路由):基于集中度对数据进行划分——低冲突(弥散更新)的样本被路由到 SFT 以进行巩固,而高冲突(集中更新)的样本被路由到 RL 以进行结构性重构。