论文
OmniHarness:通过符号策略学习利用通用视觉生成
OmniHarness: Harnessing Generalizable Visual Generation via Symbolic Policy Learning
摘要
统一的多模式大语言模型(MLLM)和多代理系统具有先进的视觉生成功能。然而,仍然存在三个限制。 (1) 现有方法通常提取特定任务的经验,但普遍性有限。 (2) 反思常常被推迟到任务完成之后。 (3) 知识通常只能在响应下游任务需求时获得。为了解决这些限制,我们引入了 OmniHarness,这是一个通过符号策略学习进行泛化视觉生成的框架。 OmniHarness 将经过验证的执行抽象为视觉生成任务系列的符号策略,捕获共享过程和适用性条件,同时删除特定于实例的输入。该工具为新任务实例化、调整和组合这些策略。中间验证指导执行过程中的细化和故障恢复。通过自主查询,OmniHarness 在指定下游目标之前自动生成并执行接近其能力限制的练习任务。执行反馈不断完善策略,同时模型参数保持固定。六个基准、三个 MLLM 主干和三个视觉代理框架的实验证明了强大的性能和持续的功能扩展。在 ComfyBench 的 Creative 任务中,OmniHarness 实现了 95.0% 的解决率,比最强基线高出 27.5 个百分点。冻结策略快照通过即插即用的重用改进了现有的可视代理系统。