论文

重新思考推理SFT的泛化:对优化、数据与模型能力的条件性分析

Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability

模型评测模型行为与机制分析

摘要

LLM后训练中一种流行的说法认为,监督微调(SFT)负责记忆,而强化学习(RL)负责泛化。我们针对采用长思维链(CoT)监督的推理SFT重新检验了这一论断,发现跨域泛化并非不存在,而是有条件的,由优化动态、训练数据和基座模型能力共同塑造。一些被报告的失败是欠优化的伪象:跨域性能会先下降,然后随着训练延长而恢复并提升(一种先降后升的模式),因此短训练检查点可能低估泛化能力。数据质量与数据结构都很重要:低质量解会普遍损害泛化,而经过验证的长CoT轨迹则带来一致的跨域收益。模型能力至关重要:更强的模型即使从一个玩具算术游戏中也能内化可迁移的程序性模式(例如回溯),而较弱的模型只会模仿表面的冗长。然而这种泛化是不对称的:推理能力提升的同时安全性下降,这将问题从推理SFT是否泛化重新框定为在什么条件下泛化、以什么代价泛化。

重新思考推理SFT的泛化:对优化、数据与模型能力的条件性分析:论文配图
图9:案例研究:同一几何题上,早期检查点(Step 40)推理冗长而浅显,后期检查点(Step 640)会回溯自纠并答对。