论文
面向中学数学自动化能力评估的异构LLM人在回路基准测试
Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics
摘要
随着能力本位教育(Competency-Based Education,CBE)在全球日渐兴起,从分数制评估转向定性能力图谱对教育者而言是一项人工难题。本文针对这一瓶颈问题,提出一个“人在回路”(Human-in-the-Loop)基准测试框架,以评估多个LLM在自动化中学数学评估上的有效性。基于尼泊尔十年级选修数学课程,我们为四个主题和四项贯穿性能力创建了多维评分量规:理解、知识、操作熟练度,以及行为与关联。多供应商组合由开源权重模型Eagle(Llama 3.1-8B)和Orion(Llama 3.3-70B),以及专有前沿模型Nova(Gemini 2.5 Flash)和Lyra(Gemini 3 Pro)组成,以两位资深数学教师定义的真值为基准进行测试(kappa_w = 0.8652)。结果显示出显著的“架构兼容性差距”。尽管基于Gemini的混合专家(Sparse MoE)模型达到“一般一致性”(kappa_w ≈ 0.38),但参数更多的Orion(70B)模型却表现为“无一致性”(kappa_w = -0.0261),表明在量规约束的任务中,架构对指令约束的遵从比原始参数规模更重要。我们的结论是:LLM尚不适合自主认证,但在“人在回路”框架内可为初步证据提取提供高价值的辅助支持。