论文
GSM-Plus-BN:孟加拉语数学推理的扰动评测基准
GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models
摘要
大语言模型数学推理评测多关注英语等高资源语言,孟加拉语的系统性扰动基准仍不足,难以检验模型是理解题意还是识别模式。论文构建经人工译者核验的GSM-Plus-BN,来自英文GSM-Plus,包含1,000个种子问题及8,000个扰动变体,共9,000个评测样本。 作者以标准提示和思维链提示评估Qwen3-32B、Llama-3.1-8B-Instant、Llama-3.3-70B-Versatile、Llama-4-Scout-17B-16E-Instruct、GPT-OSS-120B及GPT-OSS-20B。标准提示下,GPT-OSS-20B种子题准确率最高,为96.08%;Llama-3.3-70B和GPT-OSS-120B等较大模型在多种扰动上更稳健。思维链明显改善多数模型,但所有模型相对英文基准仍有差距,反映扰动孟加拉语文本的难度。论文提供这一数据集及基线,支持后续孟加拉语数学推理研究。