论文

DataArc-SynData-Toolkit:多路径、多模态、多语言数据合成的统一闭环框架

DataArc-SynData-Toolkit: A Unified Closed-Loop Framework for Multi-Path, Multimodal, and Multilingual Data Synthesis

模型训练合成数据

摘要

合成数据已成为 大语言模型 (LLM) 中数据稀缺瓶颈的关键解决方案,特别是对于专业领域和资源匮乏的语言。然而,复杂的工作流程、分散的数据标准和跨模式的可扩展性有限,严重阻碍了现有合成数据工具的更广泛采用。为了解决这些限制,我们开发了 DataArc-SynData-Toolkit,这是一个开源框架,具有以下特点:(1) 配置驱动的端到端管道,配备直观的可视化界面和简化的 CLI,具有卓越的可用性; (2)统一的、质量可控的合成范式,标准化多源数据生成,确保高可重用性; (3) 高度模块化的架构,专为无缝多模式、多语言和多任务适应而设计。我们将该工具包应用于多个应用场景。实验结果表明,我们的工具包在生成效率和数据质量之间实现了最佳平衡。通过提供端到端和可视化交互的管道,DataArc-SynData-Toolkit 显着降低了合成数据生成和后续 模型训练 的技术障碍,加速了其在实际应用中的实际部署。