论文

CHERRY:具有循环代表性产量的压缩层次专家

CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

模型优化模型压缩

摘要

前沿语言能力通常是通过前沿计算来购买的; CHERRY展示了不同的贸易方式。它是一个主权韩国模型系列,建立在一个原则之上:监督决定答案的词元,并让共享权重承担其余部分。在匹配计算下,这暴露了一种尖锐的、可重复的分离——选定的词元监督保留了保留的歧视,但破坏了自由生成,而全序列锚仅恢复了部分间隙。相同的信号驱动一个合并后修复循环表征产量循环,该循环将 48 层折叠为 6 个独特的块,以接近密集的奇偶性(227M 损失为 2.934,566M 密集模型为 2.926),并通过 MoEE 融合(2.789)将它们组成——这是一个由并发前沿循环 MoE 工作独立追求的循环压缩方向,我们项目(尚未)测量)到前沿尺度。它还安装了来自两个词元监督的元认知(200 个保留的 KO 提示/类型,kappa>0.82,+/-6.9pp):自我纠正 12->47% 和越狱 23->4%,1.2B 上的丢失保留率为 97.6%,预先注册的 1B->13.7B 消融将操作数绑定限制本地化为容量(1B)查找与 13.7B H-PRESERVE);它专门使用 1.8B 模型来报告 Cyber​​Metric 上的人类专家水平(75.0% vs 30 名专家的平均水平 72.24%)。发布的 1.8B 分词器的韩语效率比 Gemma-4 高 9.2%;从头开始 12B 添加了一个主权韩语分词器(词汇 131,037)。在政府运营的 K-AI Korean-LLM 排行榜上,发布的 1.8B 领先于 HLE(Ko) 列(0.123 vs 0.077;总体 51/78)。在前沿,我们在一个 120GB 加速器(83GB 测量峰值)上微调并提供改编的 122B 模型。出处因成员而异,我们会准确说明;架构和配方自始至终都是我们的,每项声明都必须与已发布的策划测量结果绑定。