论文

IronLLM:为实时体现智能打造紧凑的边缘本地语言模型

IronLLM: Forging Compact Edge-Native Language Models for Real-Time Embodied Intelligence

模型优化端侧模型

摘要

我们推出了 IronLLM-0.6B,这是一种 654M 参数的语言模型,专为高效的设备端推理而设计。 IronLLM-0.6B 将混合注意力架构与 X-MTP 相结合,X-MTP 是一种轻量级共享 KV 多词元预测设计,消除了每深度 KV 缓存重放,并采用轻量级验证头进行无回滚起草,实现了 1.48 倍的解码加速。该模型使用面向质量的数据管道对大约 6.2 万亿个词元进行了预训练,并使用多域按策略蒸馏进行了进一步的后训练,以集成领域专业教师的能力。为了更好地满足端上场景的低延迟需求,IronLLM-0.6B采用了Instruct-Only设计。评估表明,IronLLM-0.6B 相对于 Qwen3.5-0.8B 和 MiniCPM5-1B 等较大模型具有竞争力的性能,同时在许多任务上产生更简洁的响应。我们进一步介绍了 IronLLM-0.6B-Light,它用 Dynamic Tanh 取代了 RMSNorm,并简化了几个计算成本较高的组件,以提高推理和量化效率。 IronLLM 模型共同为资源受限的部署提供了有效的性能与效率权衡。