论文
Dynamo:视觉语言智能体的动态技能-工具演化
Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents
摘要
改善视觉语言模型(VLM)的视觉推理通常需要重训或手工设计提示与工具。我们提出Dynamo:免训练框架——不更新任何权重即适配冻结VLM。在小标注训练子集上,智能体检查自身正确与错误尝试、演化两种互补能力:认知瓶颈的可复用推理技能与感知瓶颈的可执行视觉工具。每个生成的工具配有指定何时调用的技能,两种能力类型在持久库中积累。跨四个视觉推理基准与五个VLM骨干:Dynamo在全部20个模型-基准设置上改善直接推理(平均+5.6 acc)。当预先给定工具集时,框架学习何时调用每个工具、逐步工具选择在每个受测骨干上均改善。对比任务专属RL(VTool-R1、DeepEyes):Dynamo以极少算力闭合65–99%的RL差距,并在RL可用时加性组合。
