论文
截图还是工具?混合GUI-MCP Agent的工具选择与上下文管理
Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
摘要
混合计算机使用代理可以通过截图或调用文本工具来行动。我们发现,工具的可用性不会决定效果的方向。在相同的操作系统世界-MCP基准(309个任务)上,相同的MCP工具提高了推理模型的分数+4.0pp,并降低了非推理模型的分数-5.9pp(每组5次实验,均超过2个标准差)。区别在于工具决策行为。非推理策略忽略、命名错误或虚假终止工具。推理模型避免这些失败,但仍只在309个任务中的55/309个任务上调用工具,占工具可到达的23.9%。我们称之为这种不足“采纳差距”。两个问题的根源都只有一个:模型已经有一个更便宜的路线,并且从未被训练去使用它。多轮强化学习(RL)探针在动作级别,一个密集的工具奖励提高了电子表格的采纳率0.03 -> 0.33,并影响贪婪解码,但保留后的准确性没有跟随。行为是可控的;能力不是。瓶颈在于工具调用语义。在上下文级别,成功的工具调用通常使下一个截图冗余化。取消它并减少图像历史大约三分之一,但在小精度成本下。在相同的观察规则下重新训练移除了这个成本。压缩代理随后达到37.8%的分数,而未压缩操作点为33.0%,输入成本占53%,并在注册后的退化子集中缩小了丰富的-简化的差距至零。工具帮助模型选择并集成它们,并当前混合代理留用了许多这样的选择。