论文
认知断路器:人工智能内在可靠性的系统工程框架
The Cognitive Circuit Breaker: A Systems Engineering Framework for Intrinsic AI Reliability
摘要
随着 大语言模型 (LLM) 越来越多地部署在关键任务软件系统中,检测幻觉和“伪造的真实性”已成为首要的工程挑战。当前的可靠性架构严重依赖于生成后的黑盒机制,例如检索增强生成 (RAG) 交叉检查或 LLM-as-a-judge 评估器。这些外部方法会带来不可接受的延迟、高计算开销以及对辅助外部 API 调用的依赖,经常违反标准软件工程服务级别协议 (SLA)。在本文中,我们提出了认知断路器,这是一种新颖的系统工程框架,它以最小的延迟开销提供内在的可靠性监控。通过在模型前向传递期间提取隐藏状态,我们计算“认知失调增量”——LLM 的外部语义置信度(softmax 概率)与其内部潜在确定性(通过线性探针导出)之间的数学差距。我们展示了对认知失调的统计显着检测,突出了依赖于体系结构的分布外(OOD)泛化,并表明该框架为主动推理管道增加了可以忽略不计的计算开销。