论文

面向RAG的查询感知来源风险分流

Query-Aware Source-Risk Triage for Retrieval-Augmented Generation

上下文与知识上下文工程

摘要

RAG流水线可能忽略来源与查询之间的重要关系。我们研究将该关系视为查询相关的生成前分流层,把规范化查询族路由至增强复核,并将检索页面划分为通过、补充语境、排除或复核。方法结合四维页面分数、按排名折扣的查询族聚合、保持意图的查询变换及查询族留出路由器。200个真实URL的单人标注试验提供临时校准锚点,使用合成域标识的20000行场景支持受控工作量分析。理想页面门控定义未来学习式分类器的风险覆盖目标。评估说明页面级频率为何不能替代查询族级暴露,并量化校准如何改变场景激活。标注可靠性尚未测量,合成排名不包含真实检索动态。结果是一套可审计分流方法和验证计划,而非部署复核工作量、实时网络流行率或下游答案质量收益的估计。