论文
通过强化学习提高 LLM 生成的过程模型质量:奖励函数设计的作用
Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design
摘要
大语言模型 (LLM) 可以根据自然语言描述生成 BPMN 流程模型,但有监督的 微调 (SFT) 将其输出质量限制为训练数据中存在的模式。强化学习(RL)可以使用外部质量度量来优化超出这个上限,但是当质量是多维时应该如何设计奖励函数仍有待探索。我们对基于 RL 的过程模型生成的奖励函数设计进行了系统研究,使用组序列策略优化在 48 个配置下训练两个 LLM 系列(Llama~3.1 8B、Qwen~2.5 14B),奖励来自自动评估框架,该框架包含跨句法、语用和语义质量的 38 个指标。出现了三个发现。首先,强化学习显着提高了语用和句法质量,同时保持了语义保真度,将输出的可变性减少了六倍以上。其次,等奖励权重始终优于目标权重:强调特定维度无法改进它,并且可能使模型陷入低质量模式。第三,设计选择与模型架构以非平凡的方式相互作用:无效性惩罚对于一种模型至关重要,但与另一种模型无关;SFT 初始化对于一种架构必不可少,但对于另一种架构却适得其反。这些结果表明,奖励构成是优化结果的主要决定因素,其影响与应用强化学习本身的决定一样大。研究结果适用于任何结构化生成任务,其中质量是沿着多个自动化维度进行评估的。我们在 https://github.com/chlauer99/RL_for_process_modeling 发布了我们的实现和实验代码。