论文
ElephantAgent:智能体系统中的上下文状态连续性
ElephantAgent: Contextual State Continuity in Agentic Systems
摘要
智能体系统通过调用外部工具与维护持久记忆增强能力。但这些外部依赖引入新的攻击面。近期工具与记忆投毒攻击表明恶意构造的工具描述符与被投毒的记忆可隐蔽地偏置智能体行为。这些威胁反映更深层的议题:智能体用于规划与执行的上下文状态缺乏可验证的连续性。我们提出ElephantAgent——强制上下文状态连续性以防御上下文状态投毒的协议。受既有状态连续性机制(如Nimble)启发,ElephantAgent将此类保护扩展到智能体系统不断演化的上下文状态。我们将上下文状态定义为智能体全部上下文中有界、安全攸关的子集(如工具状态与记忆)。在处理每个查询前,ElephantAgent重算本地上下文状态摘要并与最新授权摘要核对。借助复制可信硬件,ElephantAgent维护授权上下文状态转换的线性化账本并检测带外状态篡改。为应对带内语义滥用,ElephantAgent额外提供历史可追溯性——支持条件性事后审计与恢复到已知良好的先前状态。
