论文

对抗强化学习改进论证挖掘的合成数据生成

Improving Synthetic Data Generation for Argument Mining via Adversarial Reinforcement Learning

模型训练合成数据

摘要

参数挖掘(AM)从根本上受到高质量结构注释数据集稀缺的限制。虽然 LLM 在合成数据生成方面表现出了良好的前景,但生成结构准确且足够多样化的合成 AM 数据仍然是一个具有挑战性的问题。为了解决这个问题,我们从一个新的角度重新审视 AM 的合成数据生成,并提出了一种新颖的对抗性强化学习数据合成框架。所提出的框架在对抗循环中联合优化生成器和鉴别器,其中生成器生成结构化的 AM 实例,鉴别器通过区分真实数据和合成候选数据来提供学习信号。这使得生成器能够逐步提高生成的参数数据的结构准确性,同时通过对抗性反馈保持多样性。大量实验表明,所提出的框架在全数据和低资源设置下的三个基准数据集上持续提高了 AM 性能,验证了其有效性和可扩展性。

对抗强化学习改进论证挖掘的合成数据生成:论文原图
图 1:拟议框架概述。该框架由两个迭代阶段组成:生成器优化(\small{1}⃝–\small{8}⃝)和判别器细化(\small{9}⃝–\small{13}⃝)。通过交替对抗训练,生成器和鉴别器一起逐步改进。