论文
分层可变性:持久自我修改智能体的连续性与治理
Layered Mutability: Continuity and Governance in Persistent Self-Modifying Agents
摘要
持久化的语言模型智能体日益将工具使用、分层记忆、反思性提示和运行时适应结合在一起。在这类系统中,行为不仅由当前提示塑造,还由影响未来行动的可变内部状态塑造。本文提出分层可变性(layered mutability),一个跨预训练、后训练对齐、自我叙事、记忆和权重级适应五个层面对该过程进行推理的框架。核心论点是:当突变迅速、下游耦合强、可逆性弱且可观测性低时,治理难度上升,从而在最影响行为的层面与人类最易检视的层面之间造成系统性错配。我用简单的漂移、治理负载和滞后量将这一直觉形式化,将该框架与近期关于语言模型智能体时间性同一性的工作相联系,并报告一个初步的棘轮实验:在记忆累积之后,回滚智能体可见的自我描述无法恢复基线行为。在该实验中,估计的同一性滞后比为0.68。主要结论是:持久自我修改智能体的显著失败模式并非突发的失对齐,而是组合性漂移——局部合理的更新累积成一条从未被明确授权的行为轨迹。