论文
Noēsis:使用两层上下文水合的确定性优先检索,用于小型局部模型的事实关键查询
Noēsis: Deterministic-First Retrieval with Two-Tier Context Hydration for Factuality-Critical Queries on Small Local Models
摘要
错误的号码比没有答案更糟糕。跨越事实关键领域——受众指标、日程安排和媒体权利;医疗保健中的剂量和实验室值;金融和法律领域的数据和引文——自信但捏造的价值比诚实承认不确定性更具破坏性。然而,这是我们在小型本地语言模型上观察到的主要失败模式:即使上下文中存在正确的证据,模型也会伪造可信的数字和时间戳。最近的工作描述了该机制的真正限制:低于 7B 参数,检索增强生成 (RAG) 的瓶颈不是检索质量,而是上下文利用率。我们提出了 Noesis,Noesis 架构的确定性优先查询平面,它在生成之前做出每个确定性判断。其机制遵循摄取架构(单独专利申请的主题):(a)生产者端事实层逐字渲染预先计算的指标事实,而不进行排名; (b) 具有确定性跨源对齐的位置寻址,以零 LLM 成本在查询时间之前解决; (c) 出处范围作为多层命名参考路由的归因约束; (d) 具有模型触发的逐字水合作用的两层上下文。在四次消融中,2B 模型在事实完整性方面与 35B 模型达到了同等水平(所有运行中的精确值;缺失实体陷阱的虚构数字为零);结构化检索在 2B 上比平面 RAG 多出 +11.4 分;仅骨架上下文以 20-30% 较小的提示保留定量答案;水合作用可在约 8 秒和约 29 秒内恢复逐字叙述。对于受监管的域来说,有两个属性很重要:每个查询都在一次生成调用中解析,并且每个报告的值都可以通过构造追溯到其确切的来源和位置。