论文
从粗到细:以写作为中心的生成任务的基准测试和奖励建模
From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks
摘要
大语言模型 在文本生成方面取得了显着的进步,但在生成写作任务方面仍然存在困难。在评估方面,现有的基准测试对编写奖励模型的评估比较粗略,未能从具体需求的角度来衡量性能。在训练方面,现有的训练方法要么使用LLM作为法官的方法,要么训练粗粒度的奖励模型,缺乏细粒度的要求遵守奖励模型。为了解决这些问题,我们提出了一个用于编写奖励模型的细粒度评估管道 WEval 和一个细粒度强化学习训练框架 WRL。 WEval的评估数据涵盖多个任务类别和需求类型,通过衡量奖励模型排名与黄金排名之间的相关性,可以对编写奖励模型进行系统评估。 WRL 通过选择性地降低指令要求来构造正样本和负样本,从而允许更精确的奖励 模型训练。实验表明,我们的模型在各种写作基准上取得了显着的改进,并表现出很强的泛化能力。代码和数据可在 \href{https://github.com/Rainier-rq1/From_Coarse_to_Fine}{https://github.com/Rainier-rq1/From\_Coarse\_to\_Fine} 公开获取。