论文

MAP4CS:用于高效代码检索器微调的多维数据修剪框架

MAP4CS: A Multi-dimensional Data Pruning Framework for Efficient Code Retriever Fine-tuning

模型训练上下文与知识应用与实践合成数据检索增强搜索

摘要

检索增强生成 (RAG) 已成为软件工程的基石,用于通过特定领域的知识增强大型语言模型 (LLM)。然而,由于大量代码语料库固有的噪声和冗余,使检索器适应不断发展的代码存储库仍然具有挑战性。对整个语料库进行标准微调的计算成本很高,并且由于低质量样本的负迁移,通常会导致性能次优。相反,简单的随机抽样无法保证数据的代表性。为了应对这些挑战,我们提出了 MAP4CS(代码搜索多维感知剪枝),一种自适应数据剪枝框架。 MAP4CS 通过集成句法结构、语义多样性和分布式表示来识别小型、高质量的核心子集,然后是严格的基于规则的过滤管道。对两个大型数据集的大量实验表明,仅使用 5% 的训练数据,MAP4CS 的性能始终优于随机采样基线。值得注意的是,它的性能可与或 甚至优于对完整数据集进行微调,验证以数据为中心的人工智能中的“少即是多”假设。此外,语言分析揭示了一种自适应优化机制:MAP4CS 自动充当冗余语料库的去重器和混沌语料库的降噪器,构建词汇多样化且信息密集的训练语料库。