论文
喜剧愚人金:对话幽默中的奖励利用和对策
Comedic Fool's Gold: Reward Exploits and Countermeasures in Conversational Humor
摘要
我们研究了在对话幽默中训练语言模型的自动奖励,重点关注奖励利用和对策。有两种方法旨在捕捉可理解的惊喜和预测的观众娱乐。受控测试表明,基于嵌入的惊喜奖励会像接受机智的回复一样容易地接受单词打乱的回复。流畅度过滤器会检测到洗牌行为,但组合奖励也会拒绝一些俏皮的回复,从而无法进一步验证。相反,观众模型预测的笑声很容易受到任一发言者消息中的笑声暗示的影响。尽管不匹配的表达仍然可以被利用,但在不同的说话者之间规范化这些提示可以阻止所覆盖的攻击。三个强化学习运行通过连续的奖励修订来评估训练。最终运行将综合评估分数提高了 0.0903,并将零分会话减少了 40%,但其幽默特定的改进仍然低于我们预先注册的目标。这些发现说明了自动化奖励设计面临的更广泛的挑战:对策必须阻止可利用的捷径,同时保留奖励旨在鼓励的行为。