论文

ChitraMiti:孟加拉几何推理中视觉基础和模态依赖的基准测试

ChitraMiti: Benchmarking Visual Grounding and Modality Reliance in Bengali Geometric Reasoning

模型评测基准与评测资源

摘要

用于多模态数学推理的视觉语言模型 (VLM) 的评估对于低资源语言和需要同时阅读图表和问题的几何问题仍然有限。我们引入了 ChitraMiti-12.8k,这是一个包含 12,874 个孟加拉平面几何问题的综合基准,并配有结构化的 15 个属性描述;以及 NCTB-500,这是一组从孟加拉学校教科书中手动提取的 500 个图表的补充。使用将仅图表、图表加描述和仅描述输入分开的三阶段协议,我们在五个开放权重和闭源 VLM 中显示,仅描述性能与图表加描述性能在统计上无法区分,建立结构化描述作为受控评估的充分文本代理。尽管如此,模型在跨模式验证方面仍然很差,即使它们正确回答了未修改的项目,也经常被交换的空间关系误导。我们进一步评估了 ChitraMiti-12.8k 上的监督适应,发现微调提高了 ChitraMiti-1k 和 NCTB-500 的性能,尽管与最强的零样本模型仍然存在很大差距。 ChitraMiti-12.8k、NCTB-500 和我们的评估协议共同提供了一种标准化的方法来研究孟加拉语多模态几何推理,更广泛地说,研究 VLM 是否真的根据他们所看到的内容检查他们的文本。我们的数据集和代码可在 Hugging Face 上公开获取:https://huggingface.co/datasets/RaiyanKhaan/ChitraMiti。