论文
ContractNLI:标签后训练能否恢复未标注的证据?
Verdicts Without Annotated Evidence: Rejection Sampling or Label-Only Post-Training for Evidence Recovery?
摘要
在许多审核工作流程中,判决是唯一保留的内容。它后面的段落没有标记,因为注释的成本远远高于记录决定的成本。我们测量了一个小型语言模型在仅根据判决进行后训练时可以恢复多少证据,并且在任何阶段都没有人类证据标签。在 ContractNLI 上,评估之前人类证据的跨度为 保留测试。匹配记录的判决和同意这些跨度并不是一回事:在六个系统中,两个分数只是微弱相关,并且对系统的排名不同,因此当引文必须可审查时,准确性并不是一个很好的指导。仅标签训练的裸判决达到准确度 0.896 和跨度 F1 0.564。拒绝采样仅在其结论与记录匹配时才保留生成的跟踪,然后通过自动源接地分数选择一个跟踪,达到 0.797 和 0.556,而训练之前为 0.747 和 0.493。在仅标签训练下,逐字引用从 0.597 上升到 0.729,在拒绝采样下上升到 0.701。 单一语料库上的一次随机种子实验不足以判断哪种方法更好,但两者都改进了证据,而无需任何人注释。