论文
AutoDesign:用于远景代理设计的元Harness优化
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
摘要
将多模态源转换为压缩和结构化的媒体输出可以从根本上概念化为以模型Harness系统为中心的长期代理过程。虽然理想的Harness系统应该与人类设计先验保持一致,并通过实证探索积累可重用的经验,以推动递归的自我改进,但现有的范例仍然是静态的,无法实现这一能力。在本文中,我们提出了 AutoDesign,这是一个符合人类设计先验的框架,其中元Harness优化器指导代码代理根据执行轨迹反馈递归地改进Harness。为了实例化和评估这个框架,我们专注于学术论文到海报的生成任务,并引入了 PosterBench,其中包括跨越五个学科的 100 篇论文主轨和 PosterBench-mini,一个用于受控评估的共享 10 篇论文子集。在PosterBench主赛道上,AutoDesign取得了最高分78.32分,超过闭源商业系统Claude Design 7.45分。在七个受控代码代理模型配置中,集成学习的 DesignHarness 持续提高性能,将平均 PosterBench 分数从 54.99 提高到 67.39 (+12.4%)。在完全自主的长视野循环中,它可以在 40 分钟内以不到 3 美元的价格执行 253 次工具调用和 11 次编辑,达到了人类评估中的平均会议海报质量。一项系统盲人类研究进一步表明,AutoDesign 在评估的系统中实现了最高的人类偏好。