论文
HG-Bench:自动作业评估中多页手写答案区域基础的基准
HG-Bench: A Benchmark for Multi-Page Handwritten Answer-Region Grounding in Automated Homework Assessment
摘要
自动作业评估不仅取决于识别学生答案,还取决于准确定位每个答案和每个中间推理步骤在嘈杂的多页手写作业中出现的位置。本文解决了页面感知、两级答案区域基础的缺失评估设置:给定一系列作业页面图像,模型必须本地化完整的答案区域及其有序的步骤级子区域。我们引入了 HG-Bench,它是从 1,489,278 个图像源池中精选的 500 个人工注释的 K-12 作业样本的基准,其中问题级和步骤级框通过分层包含约束链接起来。 HG-Bench 与页面感知评估协议配对,该协议分别测量完整答案定位 (FA) 和步骤级分解 (FSm),揭示模型是否真正奠定了学生推理的空间结构,而不仅仅是解析可见文本。在前沿闭源 API 和竞争性开放权重 VLM 中,没有任何零样本系统在 FA 上超过 55.22%,在 FSm 上超过 48.22%,而在约 10k 域内示例上进行微调的 GLM-4.6V 9B 参考模型达到 74.97/72.26。这些结果将阶梯级手写基础确定为具体的能力差距,并为未来的自动化作业评估工作提供可重复的基准、评估协议和训练有素的参考点。