论文
用数据编程:用于自我改进的测试驱动数据工程 LLM(来自 Raw Corpora)
Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora
摘要
将人类专业知识从文本可靠地转移到 大语言模型 仍然是人工智能领域的一个基本挑战。领域语料库上的 微调 实现了可观的能力增益,但该过程在没有反馈的情况下运行:当模型在领域任务上失败时,没有方法来诊断训练数据中的缺陷,唯一的办法就是不加区别地添加更多数据。在这里,我们表明,当从源语料库中提取的结构化知识表示作为训练数据和评估的共享基础时,完整的数据工程生命周期以精确且可操作的方式映射到软件开发生命周期:训练数据变成指定模型应该学习什么的源代码,模型训练变成编译,基准测试变成单元测试,故障驱动的数据修复变成调试。在这种对应关系下,模型故障分解为概念级差距和推理链断裂,可以追溯到数据中的特定缺陷,并通过有针对性的补丁进行修复,每个修复周期都会在模型规模和架构上产生一致的改进,而不会降低总体能力。我们将这一原则正式化为“数据编程”,并将其实例化到自然科学、工程、生物医学和社会科学的 16 个学科中,并以开放资源的形式发布了结构化知识库、基准套件和训练语料库。通过证明训练数据和模型行为之间的关系在结构上可追溯和系统上可修复,这项工作为将人类专业知识可靠地工程化到语言模型中奠定了原则基础。