论文
证据第一,算术第二:DocSem 的系统报告和故障分析
Evidence First, Arithmetic Second: A System Report and Failure Analysis for DocSem
摘要
我们的 DocSem 共享任务系统 EVICALC 在官方最终测试评估中在 1,730 项任务中实现了 8.61% 的联合准确率。它读取 PDF,选择一个段落,要求语言模型编写算术表达式,并用本地代码计算该表达式。保存的中间结果支持故障检查。单独的公开验证运行实现了 92.17% 的答案准确性和 1.00 证据 F1。配置和指标不同,因此这些分数不是受控比较。我们的手动事后分析是描述性的:在一个检查的案例中,光学字符识别(OCR)和块分组将相关段落合并到另一个块中,系统从不相关的文本中进行回答。一项对阅读 100 份文档的页面图像的探索性研究仅返回了 22 份文档的证据标识符。这些描述性发现激发了进一步的评估;他们没有确定总体得分的原因。