论文
ATP-Bench:面向MLLM交错生成的智能体工具规划
ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation
摘要
文本与图像交错生成是多模态大语言模型(MLLM)的重要前沿,为传达复杂信息提供了更直观的方式。当前范式要么依赖图像生成,要么依赖检索增强,但它们通常将二者视为互斥路径,未能统一事实性与创造性。我们认为该领域的下一个里程碑是智能体工具规划(Agentic Tool Planning):模型作为中央控制器,自主决定何时、何地以及调用哪些工具,从而为视觉关键型查询生成交错响应。为系统评估这一范式,我们提出ATP-Bench,一个新基准,包含跨越八个类别与25种视觉关键意图的7,702个问答对(其中1,592个VQA对),其查询与标准答案均经人工核验。此外,为了在端到端执行与多变的工具后端之外独立评估智能体规划,我们提出多智能体MLLM-as-a-Judge(MAM)系统。MAM评估工具调用精度、识别错失的工具使用机会,并在无需标准答案参考的情况下评估整体响应质量。我们对10个最先进MLLM的广泛实验表明,模型难以进行连贯的交错规划,且工具使用行为差异显著,这凸显了巨大的改进空间,并为推进交错生成提供了可操作的指导。数据集与代码发布于 https://github.com/Qwen-Applications/ATP-Bench。
