论文
CRAFT:学习Schema,执行计划
CRAFT: Learn the Schema, Execute the Plan
摘要
企业编码智能体将自然语言分析请求转化为可在专有API、Schema与指标定义之上执行的代码。然而主流部署模式将详尽的Schema与工具文档注入每个提示词,增加了推理开销,使Schema演化复杂化,并削弱多轮分析的可靠性。我们研究稳定的Schema知识与工具使用行为能否转而通过后训练获得,同时保持面向生产的分析所要求的一致性。我们提出CRAFT,一个面向Schema锚定编码智能体的两阶段后训练配方。首先,剥离Schema的PLAN监督微调从经验证的轨迹中学习领域结构化计划与可执行行为,无需在提示词阶段注入详尽Schema。其次,以执行结果为形态的强化学习对策略进行对齐,涵盖工具选择、代码质量、计划-代码一致性以及从失败执行中恢复。训练轨迹通过Tri-Gate过滤器精选,结合执行验证、数据完整性检查与LLM裁判的推理审计。我们在广告分析的计划上线中评估CRAFT,覆盖广告活动表现分析、指标下钻、实体级表现分析以及多轮分析改进。企业评估环境将Beta API作为面向智能体的工具界面,涵盖25个Schema关联的核心实体与30个智能体工作流。相对于Schema堆填基线,CRAFT将综合Agent Score提升9.6个百分点,一致性提升4.1个百分点,多轮连贯性提升4.2个百分点,同时将输入token负担降低约9倍、Schema发现循环最多降低5倍。我们进一步报告了部署权衡、奖励塑形的局限,以及企业环境中多轮工具使用强化学习所需的训练基础设施扩展。
