论文

迈向稳健的 LLM 后训练:加固的自动故障管理 微调

Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning

AI 基础设施可观测性

摘要

强化 微调 (RFT) 已成为 后训练 大语言模型 的核心范例,但其训练过程仍然非常脆弱。现有的努力主要是通过修改RFT算法来提高系统级别的可靠性或解决单个子问题中的具体问题。尽管它们很有效,但它们在很大程度上忽视了训练过程层面的失败管理问题。当训练出现问题时,从业者仍然严重依赖专家驱动的手动检查和纠正,而 RFT 的自动故障管理在很大程度上仍未得到探索。在本文中,我们向加固 微调 的系统故障管理迈出了第一步。为了理解 RFT 故障的经验结构,我们首先构建 RFT-FaultBench,这是强化 微调 中细粒度故障的第一个基准,涵盖 5 个故障族、16 个故障类型、779 次训练运行、22,549 个训练步骤记录和 1,457,288 个轨迹级记录。基于这个基准,我们进行了全面的实证研究,表明 RFT 故障既可以从训练动态中观察到,也可以通过其经验故障指纹来区分。基于这些发现,我们提出了 RFT-FM,一种用于强化的自动故障管理框架 微调,它将异常检测、故障诊断和自动修复统一在闭环中。实验结果表明,RFT-FaultBench 既不平凡也不饱和:它表现出清晰的异常结构,同时仍然构成重大挑战,特别是在微妙的故障设置下。此外,RFT-FM在检测、诊断和缓解RFT故障方面表现出强大的能力。