论文
知道何时该相信技能:面向单智能体LLM的延迟评估与认知警觉
Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs
摘要
随着大语言模型(LLM)转变为与庞大工具生态集成的自主智能体,传统路由启发式日益受制于上下文污染与"过度思考"。我们认为,瓶颈不在于算法能力或技能多样性的不足,而在于缺乏有纪律的二阶元认知治理。本文的科学贡献聚焦于将人类认知控制——具体即延迟评估(delayed appraisal)、认知警觉(epistemic vigilance)与近端卸载区域(region-of-proximal offloading)——计算化地转译到单智能体架构中。我们提出MESA-S(Metacognitive Skills for Agents, Single-agent),一个初步框架,将标量置信度估计转变为一个向量,把自信(参数确定性)与来源置信(对检索到的外部程序的信任)分离开。通过形式化延迟程序探测机制并引入元认知技能卡(Metacognitive Skill Cards),MESA-S将对技能效用的感知与其token密集的执行解耦。在通过Gemini 3.1 Pro原生执行的上下文静态基准评估下,我们的初步结果表明,显式编程信任来源与延迟升级可缓解供应链脆弱性、剪除不必要的推理循环,并防止卸载引发的置信度膨胀。该架构朝着可靠、具有认知警觉的单智能体编排迈出了科学上审慎、以行为为锚的一步。
