论文
从生产流量到 后训练:构建涵盖企业请求组合的自托管 LLM
From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix
摘要
数据驻留限制迫使企业自行托管 LLM,但在不停用前代模型的情况下不断采用新模型会扩大服务队列,从而使有限的 GPU 池变得支离破碎。我们通过沿着三个轴(指令跟踪、函数调用和内部任务分配)的生产错误分析来缩小质量差距,从而将来自 200 多个内部应用程序的流量整合到一个模型上。质量通过根据生产流量分层的离线基准进行跟踪,并由确定性验证者或经过校准的 LLM 评委进行评分。我们不是联合优化所有目标,这会引入跨域奖励干扰,而是为每个轴训练一个单独的 GRPO 专家,并通过两阶段 SLERP 合并它们。每个专家的奖励都暴露了一种独特的失败模式,即语义崩溃、过度调用和冗长的黑客攻击,每种模式都需要针对特定领域的修复。在非推理模式下,该配方在内部 Arena 上的总参数基线上超过了 ${\sim}7\times$,为 69.6 至 65.8,指令跟随为 0.85 至 0.83,函数调用为 0.79 至 0.77,同时提升了一般对话基准。该模型吸收了 50% 的平台流量,每月 1.16 亿个请求,而服务成本只是服务成本的一小部分。