论文
Gubernaut:面向情感调节LLM智能体的确定性稳态控制器及跨独立模型家族验证
Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families
摘要
大语言模型(LLM)智能体继承了反应性失效模式:受挑衅时升级、被奉承时谄媚漂移、陷入困境时固执重复。这些是倾向性失效而非能力失效;它们关乎模型在持续压力下做什么,训练期对齐能减少但无法在运行时消除。这项研究催生了Gubernaut认知控制器(GCC),一个模型无关的运行时控制层,置于Nelson--Narens监测—控制循环中:对象层读写文本,而确定性的元层只读取数值遥测{强度、效价、重复度}并返回调节姿态。由于元层不摄入任何token,构造上就不存在通往控制器的注入通道(这是架构性质,尚未经过对抗性测试);暴露于文本的仲裁者的合规性是被测量的而非被假定的。我们以预注册的“一次生成/多次评判”协议,在四个前沿模型(GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash、Grok 4.3)组成的4x4矩阵上评估GCC,每个模型同时担任生成者与评判者。受调节组在16个单元格中的13个上更平静(p<.05),按符号计为16个中的15个;三个未达阈值的单元格(包括一个-0.04的零结果)都落在同一个近饱和宿主上。该效应在谱系独立的第四个评判家族(xAI)下依然成立,有力证明它不是共享评判风格的伪影。最清晰的机制是恢复签名:唤醒度在攻击下积分上升,随后在降温时以效价为门控而衰减,这一模式在全部四个家族中复现。转录与面板附带SHA-256来源凭证且可重新评判;五种失效模式已预注册。这项工作不提出任何意识主张。