论文

极简 RAG 模型:B1ade 335M 嵌入和 1B 参数小语言模型

Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models

上下文与知识检索增强

摘要

通常认为 RAG 系统中使用的语言和嵌入模型需要大规模预训练和显式基础监督。我们推出了 B1ade,这是一种高效的 RAG 架构,包含两个专用组件:紧凑的嵌入模型和专用的 SLM。 B1ade-embed 是通过五个预训练编码器的无参数融合构建的 335M 参数检索模型,在零额外训练的情况下在低于 500M 的模型中实现了最高 MTEB 分数;B1ade-1B 是一种在低成本 GPU 上使用组相对策略优化 (GRPO) 对精心策划的上下文问题对的标记(220 万个示例)进行训练的 SLM,其奖励仅优化答案相似性。我们的核心发现是紧急归因:尽管没有对来源引用进行明确的监督,B1ade-1B 在 42.4% 的回复中引用了检索到的段落,比其训练分布的归因率高出了 5.5 个百分点。这表明,在强化学习训练下,基于证据的回答行为可以作为一种准确性最大化策略,而无需明确的奖励工程。在标准 QA 基准上,B1ade-1B 在 PopQA 上达到 81.82%,在 PubMedQA 上达到 65.8%,在 FEVER 上达到 51.09%。在端到端 RAG 评估中,B1ade-1B 在正确性、完整性、一致性和 忠实性 方面的平均得分为 0.654,比 SFT 提高了 10.8%,同时缩小了与 1.5 倍大小模型的差距。这些结果表明,策略模型组成和奖励设计足以实现资源高效的 RAG,无需大规模预训练。