论文
LLM 后训练 作为棕地维护:数据软件工程的工业视角
LLM Post-Training as Brownfield Maintenance: An Industrial Perspective on Dataware Engineering
摘要
工业 后训练 是一个棕地政权。团队继承已部署的检查点,并且必须在固定的计算和混合预算下进行有针对性的改进,而不会影响其余部分。维护的工件越来越数据化:行为由策划的 后训练 混合物控制,通过有界混合物补丁而不是全新的重新训练进行更新。从工业代码生成改进工作中,我们从维护者的角度来解释为什么这项工作在实践中很难,提炼出三个反复出现的挑战,零和混合设计,作为约束指标的产量,以及不确定性下的端到端集成,并认为进步更多地取决于数据软件编程的工程学科,而不是一次性的配方。在我们的案例研究中,在使用相同的解决方案教师和每个候选人问题四次解决方案尝试的情况下,提高教师 蒸馏 转化为可用训练数据的干预措施将接受的监督提高了 2.84 倍。在我们的初步评估中,良率工程补丁将 CodeForces pass@1 提高了 +2.59 分 (+3.11 pass@3),并将 LiveCodeBench v6 pass@1 提高了 +6.11 (+8.05 pass@3),在每个条件下从一个固定检查点对每个基准进行 16 次随机评估时,所有这些都具有统计显着性,内部 AIME 和 MATH 回归套件在容差范围内。