论文

HANS:用于嘈杂混合文档解析的手写答题纸数据集

HANS: A Handwritten Answer Sheet Dataset for Noisy Hybrid Document Parsing

模型训练模型评测监督微调与指令调优基准与评测资源鲁棒性、公平性与可信度评测

摘要

智能评分和自动评分技术构成了智慧教育的关键基础设施。然而,现有的文档解析和手写识别基准主要是针对结构良好的印刷文档或孤立的数学表达式而设计的,缺乏能够捕获学生答卷固有的复杂特征的数据集,包括多行推导过程、文本和数学公式的异构混合以及删除线等噪声伪影。为了解决这一差距,我们引入了 HANS,这是第一个为现实世界教育场景明确构建的数据集,包含数学表达式、自然语言文本、手绘表格以及包括更正和删除在内的各种噪声模式,并附有细粒度注释,为稳健的识别研究奠定了可靠的基础。基于 HANS,我们提出了 NA-GOT,这是一种端到端框架,通过在特征级别运行的轻量级噪声抑制模块实现两级噪声抑制,并辅以 纳入解码阶段的噪声感知注意机制。实验结果表明,HANS 对现有方法提出了实质性挑战,而 NA-GOT 在答案过程识别的准确性和稳定性方面取得了显着提高。该数据集将在发布后公开。