论文
COMFYCLAW:面向图像生成工作流的自进化技能Harness
COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows
摘要
智能体日益被用于构建工作流并协助人类更高效完成重复任务。随着这些工作流被重复且领域特定——智能体记忆与可复用技能日益重要:智能体应能从先前运行中回忆工作流模式、执行约束与用户偏好。我们在基于工作流的图像生成中研究该问题——并介绍COMFYCLAW——控制ComfyUI工作流的智能体技能演化测试框架。COMFYCLAW将工作流构建形式化为类型化图编辑——按构建阶段组织工具——自动回滚无效编辑——并用区域级视觉语言模型(VLM)验证器将视觉失败转化为可行动的修复建议。该框架进一步演化渐进披露的技能库——将先前运行的轨迹、执行错误与验证器反馈蒸馏为可复用的Agent Skills。跨四个基准划分、三个智能体模型与两个图像骨干——COMFYCLAW在全部六个智能体配置中取得最佳平均图像生成评估分——超越无技能演化的仅验证器基线。人类标注进一步表明标注者偏好COMFYCLAW胜过无技能演化变体。我们的结果表明技能演化是提升智能体在重复视觉工作流构建中可靠性与性能的有效机制。
