论文

Trivium:时序遗憾作为因果记忆构造的一等目标

Trivium: Temporal Regret as a First-Class Objective for Causal-Memory Controllers

上下文与知识记忆Agent记忆

摘要

许多代理系统和大语言模型管道通过优化结果奖励来纠正错误。这仅解决了失败的原因;原因和时间可能不会被记录,从而导致相同的错误在各个事件中重复出现。我们提出长期的时间遗憾以及结果遗憾和认知遗憾。这些是诊断量,而不是基于标准比较器的在线学习遗憾。暂时遗憾反映了未解决或不正确的因果模型可以容忍多长时间;认知后悔捕获了该模型的后验错误。在一系列 E 事件流中,我们在显式探测、持久性和可检测性假设下证明了三个条件结果。首先,在观察等效的混杂条件下,仅结果学习无法将因果结构与虚假结构区分开来,因此在结果后悔达到零后,错误校准可能会持续存在。其次,通过持续的因果日志和预算探针,总探针复杂度是 E 的对数,导致 O(log E) 延迟识别时间遗憾。所实现的剪切软分数添加了线性数字下限,因此该对数声明仅适用于识别延迟。第三,在 K 个可检测的变化点下,速率扩展到 O(K log E)。我们实例化 Trivium 并陈述五个可证伪的预测。在 CausalBench-Seq 上,硬结构读数在 500 个剧集和 20 个种子中记录了每个种子 7.8+-2.9 个错误识别的剧集,观察到的平稳误差为零,而仅结果控制器在整个过程中仍然被错误识别。审计消融表明,持续的后部更新,而不是检测器重新打开或局部修复,推动了后部恢复;相反,本地修复减少了提交图调度的暴露。先前基于修剪软乐谱的对数包络判决被撤销。试点真实大语言模型流提供了外部证据。这里的自学意味着修改外部因果模型,而不是重新训练 LLM 权重。

Trivium:时序遗憾作为因果记忆构造的一等目标:论文配图
图 4:跨情节控制设置中暂时后悔的说明性示例。只注重结果的反馈可能会将在多风的沿海着陆区的重复失败概括为“避开所有沿海着陆区”的错误规则。相反,具有时间遗憾意识的因果记忆控制器会积累跨事件和车辆的证据,将风/湍流识别为相关原因,并更新策略以仅在因果条件下避免或适应。该图仅供说明; CausalBench-Seq 提供受控结构证据,附录 W 提供初步的真实 LLM 试点。