论文
RAGthoven 在 SemEval-2026 上的任务 1:多阶段管道进入基准并勉强清除标准
RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar
摘要
我们介绍 RAGthoven,这是我们用于 SemEval-2026 任务 1 (MWAHAHA)、子任务 A(英语、西班牙语和中文的多语言受限幽默生成)的系统。 RAGthoven 将创造性文本生成分解为多阶段 大语言模型 (LLM) 管道(规划器、Best-of-N Writer、自我批评反射器、LLM-as-a-judge Judge),该管道以计算幽默理论(良性违规理论、基于脚本的幽默语义理论)为基础,并通过十个实验进行完善。在我们的最终配置中,我们通过来自精选笑话语料库的检索增强生成(RAG)来增强规划器,并用不同的笑话机制播种生成。我们还评估了两种代理变体——ReAct 式顺序工具调用 (Exp09) 和自主多分支编排 (Exp10)——它们通过确定性 ConstraintAudit 检查器公开相同的四个阶段。在保留的 12 个实例英语样本上的四个前沿模型中,尽管工具调用预算大幅提高,但我们认为这两种代理变体都没有产生优于非代理管道的输出。 RAGthoven 在所有三种语言中与 Gemini 2.5 Flash 基线共享排名 1,并且组织者报告的置信区间重叠。在西班牙语中,它领先基线 42 个原始 Elo 点(1182 比 1140),而在英语(1045 比 1081)和中文(1045 比 1053)中,基线在相同的统计平局中保持更高的原始评级。总之,这些结果表明,一旦强大的前沿模型进入循环,复杂的多阶段提示工程和代理脚手架的语言依赖性收益就会递减。