论文
Causal Core:分离任务充分性与因果机制记忆
Causal Retention in Interactive Agents: Interface Factorization and Selective Adaptation
摘要
任务表现并不决定智能体保留了哪些干预机制。本文研究因果保留:冻结的学习状态能否回答独立于训练固定的机制探针映射,其中包括动作、上下文、直接目标、数值和延迟。对有限结构因果模型类,最优探针误差是贝叶斯决策风险;当且仅当学习接口的每个纤维(具有相同接口输出的原像集合)都包含于一个探针答案纤维中时,该风险为零。对接口作后处理得到的任何状态,都继承同一下界。后验覆盖定理刻画预算受限的重测;精确编辑分解表明,发生变化的集合是无误差目标更新的唯一支持集。Causal Core通过证据门控写入、读出过滤、时间信用分配、隐藏上下文设置和局部诊断更新实现这些条件。实验覆盖有限因果系统、连续仿真器、官方TD-MPC2世界模型和Qwen2.5-7B-Instruct。冻结Qwen末层探针在源机制上达到0.958平衡准确率,但在延迟改变时为0.583;门控机制状态达到1.000,且只接纳5.6%的同步读出候选。在TD-MPC2中,每个执行器五种目标状态将效应符号准确率从0.057恢复到0.948,且未损害稳定响应。因此,因果保留不同于任务充分性和源域可解码性。