模型

Carbon:Hugging Face的基因组基础模型家族

Carbon 基因组基础模型家族发布

模型训练预训练

概述

Hugging Face于2026年5月发布Carbon基因组基础模型家族,一组面向基因组研究的因果语言模型,训练规模约1万亿个DNA token。架构特点是混合分词器,可在英文文本与DNA 6-mer表示间切换,使同一模型能同时处理生物序列与自然语言,为基因组研究与跨模态任务提供基础模型底座。代码已在GitHub的huggingface/carbon仓库公开,模型规格以官方发布为准。