论文

ProUIE:基于LLM的通用信息提取的宏观到微观渐进学习方法

ProUIE: A Macro-to-Micro Progressive Learning Method for LLM-based Universal Information Extraction

模型训练强化学习

摘要

基于 LLM 的通用信息提取 (UIE) 方法通常依赖于原始训练数据之外的附加信息,这增加了训练复杂性,但通常产生的收益有限。为了解决这个问题,我们提出了 ProUIE,一种从宏观到微观的渐进式学习方法,可以在不引入任何外部信息的情况下改进 UIE。 ProUIE由三个阶段组成:(i)宏观层面的完整建模(CM),在完整的训练数据上按照其内在难度顺序学习NER、RE和EE,以构建统一的提取基础;(ii)中观层面的简化对齐(SA),对目标格式简化的采样数据进行操作,对结构化输出进行精简和正则化,使其更加简洁和可控;(iii)微观层面的深度探索(DE),逐步应用GRPO对结构单元进行细粒度奖励(SFR),以指导探索并提高绩效。在 36 个公共数据集上进行的实验表明,ProUIE 持续改进了统一提取,在使用较小主干的情况下,平均 NER 和 RE 的性能优于强大的指令调整基线,并且进一步证明了在大规模面向生产的信息提取方面的明显收益。