论文
用Codenames词语联想游戏训练模型创造力
Playing with Words, Improving with Rewards: Training Language Models for Creative Association
摘要
复杂任务要求语言模型有效探索大量解法,创造力训练却受主观评价限制。研究选择Codenames词语联想游戏,同时训练发散与收敛思维,且结果可客观验证,因此无需依赖人工判断即可开展可验证奖励强化学习(RLVR)。研究训练Qwen3-1.7B、4B与8B,并在十项创造力和四项推理基准上评估。精确性与多样性的权衡随规模变化:8B更偏向创造力,1.7B与4B则以创造力为代价提高推理精确性。8B在十项创造力基准中八项取得幅度不大但一致的收益,仅轻微损失推理表现;小模型的推理任务改善更明显。结果展示以可验证游戏训练创造力的可扩展路径。