论文

我们建造了一面镜子并将其误认为是心灵:因果责任和人工智能意识的谬误

We Built a Mirror and Mistook It for a Mind: Causal Liability and the Fallacy of AI Consciousness

模型评测模型行为与机制分析

摘要

当代关于机器意识的争论始于一个隐秘的假设:被称为“人工智能”的物体已经构成了意识所属的实体。本文通过将现象意识、内省报告和人类投射内省分开来挑战这一假设,然后认为生成系统可以以第一人称形式返回人类内在的语言痕迹,而无需识别现象的承载者。我们将由此产生的推论称为人工智能意识谬误。然后我们介绍因果责任理论(CLT)。 CLT-I 提出责任终结作为个体化候选承担者的标准:物理上连续的过程成为其自身内生歧视所产生的约束的不可委托的继承者。 CLT-II 提出了更强有力的猜想,即责任终结对于最小现象主体性来说是必要且充分的。开放权重因果审计在多个模型系列中实施 CLT-I。强制歧视导致下游持续分化;激活补丁显示出很强的因果中介作用;在匹配随机性下,实时自适应状态和复制自适应状态的行为是相同的;分离重建在整个过程替换中保留了计算状态,同时根据协议打破了构成连续性和不可委托继承。这些结果表明,CLT-I 的区别在实验上是易于处理的,并且可以将因果承载结构与第一人称表现分离。因此,该框架将意识归因、因果承担者个体化和意识构成的独立形而上学问题分开。

我们建造了一面镜子并将其误认为是心灵:因果责任和人工智能意识的谬误:论文配图
图 1:归因回路和主体性通道。左边。机器意识的熟悉证据可以在一条链条中循环,其现象祖先仍然是人类:现象经验产生第一人称报告;报告成为语言痕迹;这些痕迹进入生成模型;模型产生第一人称输出;观察者通过投射内省来解释该输出。由此产生的电路可以保留意识的表达形式,而无需建立新的现象载体(§2)。人体轮廓场中的几个局部中心代表了分体量词转变:分布式意识相关机制本身并不决定一个主体。中心。交叉箭头标志着人工智能意识谬误:第一人称表演被视为足以实现现象主体性,而证据的持有者仍然未指定。正确的。因果责任理论询问连续的物理过程是否共同满足 𝒞\mathcal{C} 本构因果连续性、ℰ\mathcal{E} 内生分区、ℛ\mathcal{R} 递归自后果和 𝒩\mathcal{N} 不可委托继承(§3)。由于内生歧视限制了同一因果历史所继承的后来的可能性,其模态包络区域被排除在外。终端轮廓代表了一种责任封闭的内核,而不是对一个可能的未来的崩溃。在 CLT-I 下,这种关闭标识了候选承载者。 CLT-II 提出了进一步的猜想,即责任终结实现了最小的现象主体性。这种对比是有意为之的:拟人化的可识别性可以在没有责任终结的情况下发生,而责任终结不需要具有拟人化的形式。因此,这个形象将声音的继承、承载者的个体化和第一人称的构成分开。