论文

HumorGen:通过基于角色的 蒸馏 在 大语言模型 中产生幽默的认知协同作用

HumorGen: Cognitive Synergy for Humor Generation in Large Language Models via Persona-Based Distillation

模型训练合成数据

摘要

幽默的生成对 大语言模型 (LLM) 提出了重大挑战,因为他们的标准训练目标(下一个标记预测)本质上与喜剧所需的惊喜和不协调相冲突。为了弥补这一差距,我们引入了认知协同框架,这是一种受幽默心理学理论启发的生成高质量幽默数据的方法。利用混合思想(MoT)方法,我们部署了六种认知角色(例如,荒诞主义者、愤世嫉俗者)来针对给定的提示综合不同的喜剧观点。该框架生成一个基于理论的数据集,我们用它来微调 7B 参数学生模型。我们进一步评估了两种对齐策略,直接偏好优化(DPO)和离线组相关变体 O-GRPO,发现两者都比 SFT 没有改进。然而,我们的 7B HumorGen 模型变体显着优于更大的指令调整基线,并实现顶级开放权重性能,同时保持与前沿专有系统的竞争力。这些结果表明,认知驱动的数据管理比幽默生成的对齐算法或模型规模更重要。