论文
Salesforce Koa:面向企业智能体工具调用的语言模型
Salesforce Koa: An Enterprise Language Model for Agentic Tool Use
摘要
我们推出了 Salesforce Koa,这是一种企业语言模型,通过使用组相对策略优化 (GRPO) 对开放权重 Nemotron-3-Super-120B 基础模型进行后训练和强化学习而构建。 Salesforce Koa 接受了公共数据和综合生成数据的训练,没有客户数据,以改进工具使用和代理功能,同时保持强大的通用性能。其独特的组件是模拟到奖励管道,它将工作流程规范扩展到角色条件的多轮任务,并根据成功使用工具来处理依赖于数据的请求而提供任务解决奖励。对于企业域,这些规范以 Agent Script 编写,Agent Script 是 Salesforce 用于构建 Agentforce 代理的声明性语言;对于公共工具使用领域,我们直接综合工作流结构。相同的模拟和基于执行结果的奖励机制在两者中驱动 GRPO。在公共工具使用、代理推理和企业客户关系管理 (CRM) 基准方面,Salesforce Koa 在其开放权重基础上进行了改进,在多轮工具使用方面取得了最明显的收益,并超越了强大的专有基线,同时保持低于最强的前沿模型。这些结果表明,规范驱动的强化学习是专门用于企业代理任务的开放权重基础模型的实用途径。