论文

LA-RL:信息提取中强化学习的标签感知自我反思

LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction

模型推理推理验证与自校正

摘要

大语言模型 在信息提取 (IE) 方面显示出强大的前景,但现有的基于反射的校正方法通常与结构化提取输出不一致。自由形式的自我反思可以标记错误,但它很少识别失败是否是缺失的范围、错误的标签、边界不匹配、无效的关系类型或颠倒的参数顺序。我们引入 LA-RL(标签感知反射强化学习),这是一种结果监督框架,可通过基于任务的诊断标签指导 IE 自我纠正。单个主干网络首先预测提取,诊断特定于任务的错误标签,然后根据诊断修改其输出。训练从冷启动监督 微调 注释模型标记的诊断数据开始,并通过两个 GRPO 阶段进行,奖励最终提取质量、格式有效性和首次通过正确性,而无需过程奖励模型。命名实体识别、关系提取和事件提取的实验表明,与 SFT 相比,相同主干的增益一致,包括 SciER 关系提取上的平均 F1 为 6.83,分布外关系提取上的 F1 约为 20,以及 DuEE1.0 上的 14.80 触发 F1 加上 17.50 参数 F1。消融表明反射结构是任务敏感的:更强的约束有利于关系提取,而命名实体识别在域转移下需要较少的限制性校正。