论文
STAR-OPD:结构化方面级联感知 同策略 针对 ABSA 四重提取的奖励 蒸馏
STAR-OPD: Structured Aspect-Cascade-Aware On-Policy Reward Distillation for ABSA Quadruple Extraction
摘要
基于方面的情感分析 (ABSA) 四重提取需要联合预测通常包含多个细粒度情感元组的评论的目标、方面、观点和情感。虽然大型思想链 (CoT) 模型在此任务上表现良好,但将它们提炼成更小的可部署模型仍然很困难。我们在精炼 ABSA 提取中识别出特定于任务的失败模式:目标方面接口处的学生错误会创建结构上无效的状态,例如损坏的目标方面绑定和幻觉目标,然后破坏下游预测。传统的 离策略 蒸馏 不太适合这种设置,因为它仅在教师生成的轨迹上进行训练,并且对学生引发的主导推理的结构状态提供很少的监督。为了解决这种不匹配问题,我们提出了 STAR-OPD(结构化方面级联感知 同策略 奖励 蒸馏),它建立在通用 同策略 蒸馏 之上,并将其实例化为具有级联感知、集合结构奖励的 ABSA 四重提取。 STAR-OPD 对学生展示进行训练,并应用直接针对绑定一致性、目标基础和细粒度方面消歧的集合结构奖励。 E-ABSA20K 和 SemEval-2014 上的实验表明,STAR-OPD 始终优于 离策略 和一般 同策略 基线,减少了目标幻觉,并显着提高了结构困难情况下的性能。借助 Qwen3-4B,STAR-OPD 大大缩小了师生差距,同时提高了推理效率,凸显了 同策略 结构校正对于蒸馏 ABSA 提取的重要性。