论文

CRAFT:学习Schema,执行计划

CRAFT: Learn the Schema, Execute the Plan

模型训练强化学习Agentic RL

摘要

企业编码智能体将自然语言分析请求转化为可在专有API、Schema与指标定义之上执行的代码。然而主流部署模式将详尽的Schema与工具文档注入每个提示词,增加了推理开销,使Schema演化复杂化,并削弱多轮分析的可靠性。我们研究稳定的Schema知识与工具使用行为能否转而通过后训练获得,同时保持面向生产的分析所要求的一致性。我们提出CRAFT,一个面向Schema锚定编码智能体的两阶段后训练配方。首先,剥离Schema的PLAN监督微调从经验证的轨迹中学习领域结构化计划与可执行行为,无需在提示词阶段注入详尽Schema。其次,以执行结果为形态的强化学习对策略进行对齐,涵盖工具选择、代码质量、计划-代码一致性以及从失败执行中恢复。训练轨迹通过Tri-Gate过滤器精选,结合执行验证、数据完整性检查与LLM裁判的推理审计。我们在广告分析的计划上线中评估CRAFT,覆盖广告活动表现分析、指标下钻、实体级表现分析以及多轮分析改进。企业评估环境将Beta API作为面向智能体的工具界面,涵盖25个Schema关联的核心实体与30个智能体工作流。相对于Schema堆填基线,CRAFT将综合Agent Score提升9.6个百分点,一致性提升4.1个百分点,多轮连贯性提升4.2个百分点,同时将输入token负担降低约9倍、Schema发现循环最多降低5倍。我们进一步报告了部署权衡、奖励塑形的局限,以及企业环境中多轮工具使用强化学习所需的训练基础设施扩展。

CRAFT:学习Schema,执行计划:论文配图
图 1.CRAFT 系统概览。在现有图表中,离线企业数据库是评估环境中受控的模式链接数据组件,其面向工具的表面包含测试版 API。 Tri-Gate 过滤器产生 15.1K 个可接受的轨迹; PLAN SFT 从推理中删除了详尽的模式上下文;四阶段管道:以企业为基础的轨迹蒸馏;三门过滤;模式剥离计划监督微调; GRPO 具有执行型奖励。