论文
MMLongBench-Doc-V2:修正标注并考虑语义的文档基准修订
MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc
摘要
MMLongBench-Doc是一个包含1082个问题的长文档问答基准,覆盖135个PDF文件。该基准有两个显著特点使评分偏离其本意:参考指标比较提取的答案,因此1,358,000与1,358,000失去平衡;且大量标注错误、模糊或不完整——因为它们是如何找到的,集中在正确回答这些问题的系统。MMLongBench-Doc-V2纠正了106个注释,每个注释都附有页面和计算结果来解决它,并用固定模型代替字符串指标,询问响应是否意味着参考。由于文件名错误,10个文档中的10个问题被移除而不是标记为错误,同时保留了一个重复的问题,剩余1,071个问题覆盖134个文档。最可重用的贡献是当空集键可以扩展时,以及当扩展会破坏故意设置的负面样本时,决策程序;应用于所有208行,它扩大了14个。V2评分与已发布的V1评分不可比。修正后的基准、每条记录的纠正记录和评估框架可在https://github.com/VectifyAI/MMLongBench-Doc-V2处获得。