论文
Learn-by-Wire训练控制治理:应力下有界自主训练以实现稳定与高效
Learn-by-Wire Training Control Governance: Bounded Autonomous Training Under Stress for Stability and Efficiency
摘要
现代语言模型训练日益面临不稳定、劣化运行与算力浪费,尤其是在激进学习率、规模与运行时应力条件下。本文提出Learn-by-Wire Guard(LBW-Guard),一个运行于AdamW之上的有界自主训练控制治理层。LBW-Guard不取代优化器更新规则,而是观察训练遥测数据,识别对不稳定敏感的状态区间,并在保持固定训练目标的同时对优化器执行施加有界控制。我们在以Qwen2.5为中心、使用WikiText-103的应力与鲁棒性测试套件中评估LBW-Guard:以Qwen2.5-7B为实证锚点,与Qwen2.5-3B和Qwen2.5-14B做模型规模对比,进行学习率应力测试和梯度裁剪基线对比,并以无LoRA的TinyLlama-1B全参数设置做健全性检验。在7B参考设置下,LBW-Guard将最终困惑度从13.21降至10.74,改善18.7%,同时把端到端时间从392.54秒缩短至357.02秒,实现1.10倍加速。在更强的学习率应力下,AdamW在LR=3e-3时最终困惑度恶化到1885.24,在LR=1e-3时为659.76,而LBW-Guard分别保持在11.57和10.33,仍可训练。梯度裁剪基线无法复现这一效果。这些结果支持一个有边界限定的系统结论:对稳定敏感的LLM训练可以从优化器之上的治理平面中获益。LBW-Guard提供的证据表明,有界的运行时控制能够在应力下保住有效算力,同时区别于替换优化器与局部梯度抑制。