论文
FAB-Bench:半导体制造中自适应 RAG 基准测试框架
FAB-Bench: A Framework for Adaptive RAG Benchmarking in Semiconductor Manufacturing
摘要
检索增强生成 (RAG) 已成为知识密集型应用的关键,但由于领域复杂性、上下文规模多样以及严重依赖昂贵、不一致且不可扩展的专家评估,评估其在垂直领域的性能仍然很困难。我们推出 FAB-Bench,这是一种用于半导体制造中 RAG 系统自适应基准测试的端到端框架。 FAB-Bench 定义了六种诊断指标,用于衡量事实准确性、上下文利用率、完整性、检索相关性、技术深度和推理一致性。该框架将 检索器 诊断与跨 4K-32K 词元上下文窗口的生成器级推理分析相结合,量化检索精度和生成保真度如何随着上下文范围的扩展而共同发展。从 1,300 多个生成的候选中,我们策划了 200 个查询-答案对的高质量基准,涵盖三种综合策略:大海捞针、文档内多主题和跨文档多跳。对四个 LLM 和四个 RAG 框架的系统评估揭示了三种不同的上下文扩展行为:对数增长、早期饱和和冷启动动态,并确定注意力稀释是极端上下文长度下性能下降的主要机制。对另外三个生产 RAG 系统进行的跨框架验证证实了评估的可移植性。