论文

通过韩国开放公共 API 进行多步工具调用:基准和数据合成方法

Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe

模型训练强化学习合成数据RLVR

摘要

数据主权法规越来越要求公共机构部署开源的本地 LLM 智能体,这些智能体跨实时政府 API 链接多个工具调用。然而,开源模型在这种多步骤设置中始终表现不佳,并且没有现有的基准来衡量差距。我们引入了韩国开放公共 API 基准 (KOPA-Bench),其中包含 145 项实际任务。为了弥补这一差距,我们提出了 EDGE,这是一种基于执行的动态图,用于由实时执行驱动的工具调用数据合成。 EDGE 构建一个图表,显示每个工具的输出如何提供另一个工具的输入,仅保留实际调用实时 API 时成功的链接,并遍历这些经过验证的链接以合成可执行的多步轨迹。通过 GRPO 对生成的数据集进行微调,我们的 9B 模型几乎与同一系列中未调整的 27B 模型相匹配,不仅在 KOPA-Bench 上而且在 BFCL 基准上都有显着改进。

通过韩国开放公共 API 进行多步工具调用:基准和数据合成方法:论文配图
图1:韩国公共API微调前后的工具调用轨迹对比。 (a) 失败案例(微调之前):智能体无法检索 API 密钥,即使在成功检索有效密钥后,它也仅根据分页 API 响应的第一页做出不完整的回答。 (b) 成功案例(微调后):智能体成功链接工具输出、查询多个页面并聚合结果以提供准确的答案。