论文
以效率超越规模:原生适合孟加拉语的紧凑型 135M 参数基础 LLM
Surpassing Scale by Efficiency: A Compact 135M Parameter Foundational LLM Natively Adapted for the Bangla Language
摘要
虽然 NLP 领域以数十亿参数架构为主,但它们在低资源、非拉丁脚本中的部署对于边缘配置、移动系统和分散的本地硬件来说在计算上仍然令人望而却步。本文提出了 bangla-smollm-135m,这是一种高度紧凑的、仅包含 1.35 亿个参数的解码器基础模型,专为孟加拉文字中的高效语言建模而专门设计。通过利用 TituLLM 和 SmolLM2-135M 之间的确定性交叉和附加标记合并策略,该模型克服了子字脚本碎片,而不会破坏早期预训练参数状态的稳定性。在零样本多任务基准评估(PIQA_bn、OpenBookQA_bn、CommonsenseQA_bn 和 Bangla_MMLU)中,bangla-smollm-135m 匹配或优于其两倍大小的模型 (Gemma-3-270m),并与 1B 参数层中的模型达到同等水平。该模型可在 rnnandi/bangla-smollm-135m 上找到