论文

开放、可靠与集体化:面向工具使用AI智能体的社区驱动框架

Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents

智能体系统Agent 工具调用

摘要

工具集成的大语言模型可以通过外部工具检索、计算和采取现实世界的行动,但可靠性仍然是一个关键瓶颈。我们认为失败源于工具使用准确性(代理调用工具的程度)和内在工具准确性(工具本身的正确性),而大多数先前的工作强调前者。我们推出了 OpenTools,这是一个社区驱动的工具箱,它可以标准化工具模式,提供轻量级的即插即用包装器,并通过自动化测试套件和持续监控来评估工具。我们还发布了一个公共网络演示,用户可以在其中运行预定义的代理和工具并贡献测试用例,从而使可靠性报告能够随着工具的变化而发展。 OpenTools 包括核心框架、初始工具集、评估管道和贡献协议。实验和评估表明端到端的可重复性和任务性能得到了改善;社区贡献的、更高质量的特定任务工具在下游任务和基准测试方面比跨多个代理架构的现有工具箱提供 6%-22% 的相对收益,凸显了工具内在准确性的重要性。

开放、可靠与集体化:面向工具使用AI智能体的社区驱动框架
图 1:OpenTools 支持两种互补的工作流程。顶部(维护):OpenTools 存储工具和测试;社区模块收集新工具/测试/反馈,由验证者(工具创建者/维护者)审核以接受、策划和更新规范工具箱和评估套件;然后工具评估模块重新运行标准化检查以刷新内在可靠性信号(准确性、可用性、回归)。底部(代理):用户输入查询(可选文件)并从 OpenTools 框中选择工具;代理模块决定操作并请求工具调用;执行模块运行工具来返回观察结果并通过结构化工具/推理日志生成最终答案,同时可选的 UI 反馈反馈到社区层。