论文
GEIS:长篇文章生成的代理技能的生成-评估-改进循环
GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation
摘要
对于 大语言模型 来说,长篇文章生成仍然很困难,因为它结合了长上下文、长指令和长输出。现有的多智能体管道(例如 STORM)通过模拟角色专用智能体来提高信息覆盖范围,但它们的功能往往与提示和固定程序纠缠在一起,导致难以检查、重用或迭代改进。本文提出了 GEIS(代理技能的生成-评估-改进循环),这是一个用于维基百科风格的长篇文章生成的命名和声明性技能的循环。 GEIS 在 Tasi Harness 中实施和评估,涵盖了文章写作、基于浏览器的证据和图像收集、图表渲染、PDF 感知成对评估和规则级技能改进的技能。其核心写作技能遵循请求、计划、起草、审核、完善和交付;成对评估技能可生成结构化的质量报告;在我们的 20 个主题的实验中,改进技能将反复出现的发现映射到写作技能的永久补丁中。我们根据 20 个维基百科专题文章主题评估 GEIS。在同一代后端下,GEIS 在 100 点 PDF 质量标准上比 Tasi Harness 默认编写器提高了 8.0 分,并且在两个可比较的书写维度、结构质量和内容质量上优于 STORM。在20个主题的改进实验中,修补后的写作技巧将平均分从82.90提高到86.95,20个主题中有17个得到改进,收益主要来自内容质量。这些结果表明,长格式生成可以从固定的工作流程重新构建为可检查、模块化和评估引导的改进循环。