论文
FTW:交叉熵方法实现无评论家的RFT
Follow the Winners: Conservative Policy Improvement with the Cross-Entropy Method for Critic-Free RFT
摘要
面向Agentic 智能体大语言模型的无评论家强化微调(RFT)常通过GRPO式方法进行——在重复rollout上计算组基线以降低目标方差。但该设定不适合在活服务或安全沙箱等有状态环境中行动的智能体:重复rollout不切实际,激进更新会把长且稀疏验证轨迹的噪声固化。我们提出Follow the Winners(FTW)——把交叉熵方法适配到RFT的无评论家策略学习算法:以对回放缓冲样本的序数过滤器取代组rollout,在回报的顺序统计量上产生多项式集中。我们经"控制即推断"透镜推导FTW——它也把GRPO与DPO恢复为特定建模选择:GRPO是风险中性的,DPO与FTW共享有界风险寻求偏移而FTW控制之。我们把该偏移识别为通过对样本的序数过滤器降低方差的固有权衡,而评论家模型引入偏置-方差的不同权衡。扩展到智能体LLM后训练,FTW在Sokoban与Search-R1基线上匹配GRPO与PPO,展示了从价值模型或组rollout到CPU内存的可行权衡。