论文
MathShikkha:小语言模型孟加拉语数学推理中仅答案与思维链监督的受控研究
MathShikkha: A Controlled Study of Answer-Only and Chain-of-Thought Supervision for Bangla Mathematical Reasoning in Small Language Models
摘要
数学推理在孟加拉语等低资源语言中仍具挑战性。我们研究教师生成的孟加拉语思维链(CoT)监督是否提供超越普通监督微调的收益。我们构建孟加拉语数学推理数据集MathShikkha(含GPT-5.4生成的推理依据),并在匹配协议下微调四个4B-7B学生模型:仅答案与CoT两种条件共享数据划分、仅响应损失掩码、解码与评分,仅训练目标不同。在域内,对三个较强骨干,CoT相对仅答案微调无显著改进(配对自助95%置信区间包含零;精确McNemar p ≥ 0.17),尽管其生成的token多15-52倍;但对较弱的4B模型显著提升18.56分(p < 0.0001)。在更大的、经污染审计的BanglaMATH基准上,这一模式反转:对全部四个模型,CoT显著优于仅答案监督20.1-28.1分(均p < 0.0001)。仅答案微调还使三个模型的域外准确率降至基础模型之下,而CoT对全部四个模型保持或提升域外准确率。由两位合作者标注、外部专家裁定、Cohen's κ为0.76-1.00的人类研究发现,在推理内容标准上CoT相对基础模型无显著改进;其可测量的效应在于目标语言遵从与产生可检视的推理。总体而言,推理依据监督的价值取决于骨干能力与分布偏移:在此设置下,其主要收益是孟加拉语遵从、可审计推理与域外鲁棒性,而非域内推理有效性的提升。
