论文
EditPropBench:测量科学手稿中的事实编辑传播
EditPropBench: Measuring Factual Edit Propagation in Scientific Manuscripts
摘要
科学手稿中的本地事实编辑通常会产生非本地修订义务。如果数据集从 215 个文档更改为 80 个文档,诸如“中等规模”或“几百个项目”之类的声明也可能会变得过时,即使它们不重复编辑的数字。在对最近 arXiv cs.CL 基准和数据集论文的审计中,我们发现 37.2% 的论文中存在依赖于事实的定性声明,这表明这种依赖性模式在目标类型中很常见。我们引入了 EditPropBench,这是一个衡量 LLM 编辑是否通过相关手稿声明传播事实编辑的基准。每个项目都包含 ML/NLP 风格的合成手稿、有针对性的编辑和受控事实图,其中包含直接目标的句子级标签、所需的下游更新以及应保持不变的不相关文本。我们通过编辑波纹依从性(ERA)总结了级联成功,即正确修改的所需下游更新的比例,并通过对抗性探针和压力测试变体验证了指标。在最困难的情况下,从属权利要求使用隐式或自由格式措辞而不是重复编辑的值,五个 LLM 编辑系统跨越 ERA 0.148-0.705。即使是最强的也会错过大约 30% 所需的级联更新。这一优势在混合评估中仍然存在,其中包括可通过确定性替换解决的简单情况。 EditPropBench 表明,当前的 LLM 编辑器可以修复事实编辑的许多隐含后果,但可靠的科学修订仍然需要级联感知检查。