论文

通过代理本机可重用工具原语利用 LLM 工具使用中的工程

Harness Engineering in LLM Tool Use via Agent-Native Reusable Tool Primitives

智能体系统Agent 工具调用

摘要

通过外部工具增强的 大语言模型 (LLM) 在解决复杂的现实世界任务方面表现出了卓越的能力。然而,现有方法面临两个关键挑战:由于工具输出类型和 API 模式不兼容导致的脆弱的多步和多轮推理,以及大型工具目录下的性能下降。为了解决这些问题,我们引入了 \textbf{Tool Primitives},一种用自然语言代替严格的基于 API 模式的调用作为工具调用接口的设计,其中每个工具都用 LLM 接口包装,该接口在内部处理模式解析和执行,从而实现嵌套和多轮工具调用的自然工具间通信。在工具原语的基础上,我们托管 \textbf{ToolFace},这是一个包含 25,519 个函数的集中存储库,LLM 在推理时仅动态检索相关工具,从而无需在上下文中枚举原始 API 模式。为了在复杂的设置中可靠地编排工具原语和 ToolFace,我们进一步提出了 \textbf{HEART},一个通过 \textbf{A}gent-native、\textbf{R}可用的 \textbf{T}ool Primitives 的 \textbf{H}arness \textbf{E}engineering 框架,包括规划器、路由器和验证器,共同支持动态工具调用规划、多步执行和反馈驱动的恢复。五个基准测试的实验表明,HEART 的性能平均优于基于 SFT 的模型 10\%$,平均优于 GPT-5.4、Claude-4.6-Sonnet 和 Gemini-3.1-Pro 6\%$,同时将 API 成本降低高达 85\%$。在 50 个现实世界任务中,HEART 实现了 $84\%$ 任务完成率,是三个前沿商业模型平均值 ($22\%$) 的 3.8\倍$。