论文
LongWoF-Bench:评估 EvoMap 基因以实现可验证的长工作流程任务
LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks
摘要
人们越来越期望 大语言模型 执行复杂的工作流程,其成功取决于维护相互依赖的约束并生成满足严格的端到端验证的工件。然而,成功的执行经验通常会在单次运行后丢失,迫使后续模型从头开始重新发现策略和故障模式。我们研究是否可以通过 EvoMap 将此类经验具体化和重用,其中验证者确认的执行轨迹被整合到结构化基因中。为了评估此设置,我们引入了长工作流基准 (LongWoF-Bench),其中包括 778 个机器可验证的任务,涉及代码生成、代理环境综合、数学推理和规则遵循。在具有验证者确认的 Opus 轨迹的 252 项任务中,进化的 EvoMap Gene 在所有七个评估模型中的表现优于 Skill 8.7-15.5 个百分点,并将这种优势延伸到来自不同模型系列的消费者模型。相比之下,参考蒸馏基因没有表现出相同的优势,这表明仅紧凑的表示是不够的,并且基因效用与经过验证的经验来源密切相关。对于 Claude Opus 来说,基因重用还比技能多完成了 39 项任务,同时将解决时间词元消耗减少了 9.9%。总之,这些结果表明,经过验证的执行经验可以作为可重用的外部资源保留和共享,使模型能够改善长工作流程的完成情况,而无需重复支付经验发现的全部成本。