RAGAL:政府机构的低成本全本地检索增强助手
RAGAL: A Frugal, Fully Local Retrieval-Augmented Assistant for Technical Support at a Government Agency
摘要
公共机构持有大量不能离开场所的敏感文件和支持票据,完全排除了云托管的语言模型。我们报道了 RAGAL,它是罗马尼亚农村投资融资机构 AFIR 技术支持团队的检索增强助手,在三个硬约束下构建和运行:零数据出口(无外部 API 调用,即使是合成数据)、只读任务(助手草稿、人类执行)以及作为唯一开发和训练机器的单个 8 GB 消费笔记本电脑。在包含约 25,000 个块的罗马尼亚语语料库(15,073 个已解决的支持票和内部规范文档)中,我们表明,杠杆率最高的投资是检索工程和 检索器 微调,而不是更大的生成器:具有意图路由的混合密集稀疏检索将我们的内部评估从 62% 提高到 81%,而 微调经过 72 分钟的训练后,真实票据数据上的 bge-m3 嵌入器将recall@10 从 0.663 提高到 0.850(MRR 0.489 到 0.684)。我们记录了一个普遍的陷阱:单域 微调 在库存基线以下未触及的文档域上默默地降级检索,仅在构建每个域评估集并使用本地生成的查询(GenQ)修复后才检测到。我们报告了两个反直觉的发现——PII 屏蔽提高了生成质量,结构性“锚 蒸馏”方案使 SQL 幻觉不可能通过构造实现——以及 8 GB VRAM 中完全嵌入器 微调 的可重现配方。最后,由于零出口也排除了云判断,因此我们描述了一种替代方案:在 CPU 上运行的 744B 参数模型,速度太慢,无法交互服务,但可以在夜间批量中负担得起,用作我们量化其限制的第二意见。我们为面临类似数据局部性限制的机构发布了经过净化的管道脚本。