论文
明智地行动:在代理多模式模型中培养元认知工具的使用
Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
摘要
代理多模式模型的出现使系统能够主动与外部环境交互。然而,当前的智能体存在严重的元认知缺陷:他们很难在利用内部知识和查询外部实用程序之间进行仲裁。因此,它们经常成为盲目工具调用的牺牲品,即使可以从原始视觉上下文解析查询,也会诉诸自反工具执行。这种病态行为会导致严重的延迟瓶颈,并注入额外的噪声,从而扰乱声音推理。现有的强化学习协议试图通过惩罚工具使用的分级奖励来缓解这种情况。然而,这种耦合的公式造成了一个不可调和的优化困境:激进的惩罚会抑制必要的工具使用,而温和的惩罚则完全被优势归一化过程中准确度奖励的方差所包含,使其对工具过度使用无能为力。为了突破这一瓶颈,我们提出了 HDPO,这是一种将工具效率从竞争标量目标重新构建为严格条件目标的框架。通过避免奖励缩放,HDPO 维护了两个正交优化通道:一个最大化任务正确性的准确性通道,以及一个通过条件优势估计在精确轨迹内强制执行经济的效率通道。这种解耦的架构自然会引发认知课程——迫使智能体在完善其自力更生之前首先掌握任务解决方案。广泛的评估表明,我们生成的模型 Metis 将工具调用减少了几个数量级,同时提高了推理准确性。