论文
Hunyuan-A13B技术报告
Hunyuan-A13B Technical Report
摘要
我们提出Hunyuan-A13B,一个基于混合专家(MoE)架构的开源大语言模型。它总参数量为800亿,但推理时仅激活130亿,在模型能力、计算效率与部署成本之间取得平衡。模型在经过严格过滤的20T token语料上预训练,并强化了STEM数据策展,提升了事实可靠性与推理能力。高质量监督微调与大规模强化学习进一步增强了其整体性能。Hunyuan-A13B还引入双模式思维链框架,使推理深度适配任务复杂度:常规查询用快思考,复杂多步问题用慢思考。评测显示其在数学、科学、编程、通用语言理解与Agent任务上表现有竞争力,常接近大得多的模型。其高推理吞吐使其适合延迟敏感的应用。我们开源Hunyuan-A13B以支持开放研究与LLM实际部署。