论文

AI代理架构中的语义漂洗:为什么工具边界不带来认知担保

Semantic Laundering in AI Agent Architectures: Why Tool Boundaries Do Not Confer Epistemic Warrant

模型评测模型行为与机制分析

摘要

基于LLM的代理架构系统性地把信息传输机制与认知证成机制混为一谈。我们将这类架构失败形式化为语义漂洗(semantic laundering):一种模式,其中缺乏或只有微弱担保的命题,仅因跨越了架构上受信任的接口而被系统接受为可采信。我们表明,语义漂洗构成了Gettier问题的一种架构化实现:命题获得了高认识论地位,但其证成与使其为真的事实之间没有联系。与经典Gettier案例不同,这种效应并非偶然;它由架构决定且可系统复现。核心结论是不可避免自我许可定理(Theorem of Inevitable Self-Licensing):在标准架构假设下,循环认知证成无法被消除。我们引入担保侵蚀原理(Warrant Erosion Principle)作为该效应的根本解释,并表明扩展规模、模型改进与LLM-as-judge方案在结构上都无力消除这个存在于类型层面的问题。