论文

WMT26 上的 ESTS:用于模型压缩的路由通知专家剪枝

ESTS at WMT26: Routing-Informed Expert Pruning for Model Compression

摘要

我们描述了团队名称 ESTS 向英语(简体中文)和英语(埃及阿拉伯语)无约束 WMT26 模型压缩共享任务提交的六项内容。我们为每个转换方向提交了三个压缩操作点,全部源自 GPT-OSS-20B。我们使用特定于任务的路由质量对专家进行排名,并使用跨语言路由分歧来跨层分配保留容量,然后物理删除低重要性的专家。由此产生的专家对 GPT-5.1 生成的合成翻译数据进行恢复调整,并通过将 MXFP4 量化应用于保留的专家投影权重来进一步压缩。我们还为指令条件的 WMT26 设置实现了一个强大的推理系统,包括类别推理、输出验证、重试、分段回退和源拥有的 JSON 重建。在我们的六份提交中,参数计数范围从 4.186B 到 7.770B,打包工件大小从 4.55 到 6.33~GiB。使用 GPT-5.1 伪参考的内部 xCOMET-XL 评估提供了提交的压缩操作点的内部比较。