论文

TRACER:多模式工具使用代理的可验证生成来源

TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents

智能体系统Agent 工具调用

摘要

多模态 大语言模型 通过调用外部工具进行视觉检查、OCR、检索、计算和多步推理,越来越多地解决以视觉为中心的任务。当前使用工具的代理通常会公开执行的工具轨迹和最终答案,但他们很少指定哪个工具观察支持每个生成的声明。我们将这种缺失的声明级依赖结构称为来源差距。这种差距使得工具的使用难以验证和优化,因为有用的证据、冗余的探索和不受支持的推理混合在同一个轨迹中。我们引入了 TRACER,这是一个用于多模式工具使用代理中可验证生成来源的框架。 TRACER 不是在生成后添加引用,而是生成每个答案句子以及结构化出处记录,该记录识别支持工具轮次、证据单元和语义支持关系。其关系空间包含引用、压缩和推理,涵盖直接重用、忠实压缩和依据关联推导。 TRACER 通过模式检查、工具轮换对齐、来源真实性和关系合理性来验证每条记录,然后将经过验证的出处转换为可追溯性约束和出处衍生的本地信用,用于强化学习。我们进一步构建了 TRACE-Bench,这是从粗略多模态工具轨迹进行句子级起源重建的基准。在 TRACE-Bench 上,简单地添加工具通常会引入噪音。使用 Qwen3-VL-8B,TRACER 的答案准确率达到 78.23%,摘要准确率达到 95.72%,比最强的闭源工具增强基线高出 23.80 个百分点。与仅使用工具监督的 微调 相比,它还将测试集工具调用总数从 4949 次减少到 3486 次。这些结果表明,可靠的多模态工具推理取决于对观察结果的来源感知使用,而不是仅仅依赖于更多的工具调用。