论文
自我涌现智能体架构:行为惯性、反思元认知与社会对比自建模
Self-Emergence Agent Architecture:Behavior-Inertia HMM, Reflexive Metacognition,and Social-Contrastive Self-Modeling
摘要
大语言模型智能体语言生成和问题求解能力强,却有三种结构局限:人格漂移、不能演化的反思以及缺少自我与他者边界。现有生成式智能体模拟依赖静态记忆和固定提示,既不维持行为惯性也不支持内生自演化。我们提出自我涌现架构SEAA,整合三部分:用可编辑状态转移矩阵表示长期行为和认知惯性的隐马尔可夫模型HMM;Reflexion式语言元认知循环,其输出更新HMM参数本身而非仅保存文本;以及初始相同智能体持续比较彼此行为的多智能体社会环境。三者形成社会行动→反馈→自反思→惯性更新→差异化行动的闭环。我们提出三个可证伪假设和带操作指标的可复现实验协议。无需语言模型的原型显示闭环自发打破对称:初始相同智能体形成不同且稳定的人格,匹配对照则没有。托管大模型实验将这些差异显现为不同第一人称自我叙述,五智能体讨论还自发形成共识中心和被一致拒绝的离群者,这在对照中未出现。受庄子启发,SEAA保持认识论上的不可知立场,只研究可观察行为涌现,不对主观感质作主张。本文提供统一框架、带伪代码的具体架构、机制证据及研究人工自我涌现的显微镜式沙盒。
