论文
LLM 代理的执行优先综合工具使用跟踪生成
Execution-First Synthetic Tool-Use Trace Generation for LLM Agents
摘要
代理软件工程和工业系统越来越多地通过可执行工作流程进行操作,而不仅仅是代码生成:它们搜索工件、调用工具、检查结构化观察结果和查询数据库。训练这些代理需要监控数据来捕获有效的工具交互和可执行的工作流程。然而,传统的查询优先数据合成可能会失败,因为合理的用户请求可能与有效的工具序列、兼容的参数或可用数据不对应。为了解决这个限制,我们提出了 SyntheticAgentTraceQA,这是一个执行优先的框架,用于为工具增强代理生成可扩展的监督数据。我们的框架首先构建高级工作流结构,通过依赖性感知分配将它们映射到可用工具,在受控环境中执行和验证结果跟踪,然后综合自然语言用户任务、教师生成的推理注释和参考答案。我们跨四个工具生态系统评估框架,并使用生成的数据来微调和评估 Qwen 模型变体。结果表明,基于执行的监督改善了评估任务的工具执行行为、参考跟踪一致性和答案生成性能。进一步的分析揭示了监督权衡:屏蔽监督(从训练目标中排除推理注释)改善了最终答案指标,而全面监督(包括推理标记在内的完整辅助输出的计算损失)在答案质量方面表现不佳,并且不能持续改善参考跟踪一致性,特别是在 9B 规模上。这些发现强调了根据工具增强代理的所需功能设计综合监督的重要性。