论文

CuratorKIT:LLM 后训练 的数据管理和综合数据生成

CuratorKIT : Data Curation and Synthetic Data Generation for LLM Post-Training

AI 基础设施数据基础设施

摘要

数据管理是 大语言模型 的 后训练 管道的关键部分,但现有工具通常将摄取、重复数据删除、合成生成和质量过滤视为单独的阶段。这种碎片化使得审核管道决策或理解单个样本被拒绝的原因变得困难。 CuratorKIT 是一个开源 Python 库,它在单个可配置管道中涵盖了整个生命周期。该框架由六个源格式读取器和自动模式检测、用于凭证、PII 和有毒内容的预生成数据卫生层、八个 LLM 驱动的生成任务、三个具有来源精确幻觉验证的互补质量门、结构化自适应恢复以及与 TRL、Unsloth 和 AlignTune 兼容的五种训练就绪导出格式组成。每个管道决策都记录在仅附加的每个样本来源链中,被拒绝的样本带有结构化的失败原因,而不是被默默丢弃。 CuratorKIT 通过 LiteLLM 支持 100 多个 LLM 提供程序,公开 Python API 和 YAML 驱动的 CLI,专为需要大规模可重复、可审计数据管道的从业者而设计。