论文

基于智能体AI与嵌套学习的幻觉缓解及借助语义缓存的AI可持续性

Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

智能体系统Agent 架构与控制循环

摘要

幻觉仍然是生产大语言模型系统的主要可靠性障碍,特别是在多代理管道中,不受支持的声明可以在各个阶段之间不受控制地传播。本文采用了受 HOPE 启发的嵌套学习架构,采用连续记忆系统 (CMS) 和语义相似性缓存,以适应 310 个提示的混合基准,其中包括 217 个认知不确定性提示和 93 个制造归纳压力测试提示。通过开放层协议 (OFP) 编排的三阶段代理管道通过五个 KPI 进行评估——FCD(事实声明密度)、FGR(事实依据参考)、FDF(虚构免责声明频率)、ECS(显式情境化分数)和 OSR(可观察性分数比)——跨五个权重配置汇总到 THS(总幻觉分数)中,以研究缓解-可观察性权衡。 FDF、ECS、OSR 和 FGR 被减去作为缓解信号,因此 THS 负值越大表示缓解越强。 FrontEndAgent 配置为高随机性生成器(温度 = 1.0)以生成真实的幻觉基线,而 SecondLevelReviewer 和 ThirdLevelReviewer 则作为渐进校正器运行。这种不对称设计在五种加权配置中使端到端 THS 降低了 -31.3% 至 -35.9%。语义缓存在 930 个潜在调用中实现了 440 次缓存命中(命中率 47.3%),将 LLM 调用减少到 490 次,降低了能源和 CO2e 足迹,并使多阶段审查管道在生产规模上可行。 ExtremeObservability 达到了最负的最终 THS (-0.0709),证实了可观测性重的配置增强了而不是妥协了缓解措施。这些发现表明,记忆增强的多智能体设计可以共同提高事实可靠性、操作效率和可审计性,而无需模型重新训练。

基于智能体AI与嵌套学习的幻觉缓解及借助语义缓存的AI可持续性
图 5:实验管道执行流程。 310 个提示中的每一个都流经三代理管道,并在每个阶段进行 CMS 查找 ( τ = 0.87 \tau=0.87 )。 KPI 评估器(第四个代理)接收所有中间输出以计算 FCD、FGR、FDF、ECS 和 OSR 指标,从而实现跨五种配置的 THS 计算。