论文

将逻辑与角色表达分离,减少边缘LLM的上下文污染

Decoupling Logic from Persona: Structural Immunity of Edge LLM Agents to Context Pollution

智能体系统上下文与知识模型优化上下文工程Agent 架构与控制循环端侧模型

摘要

边缘设备上的小型语言模型Agent必须在一个充满对话历史和角色指令的上下文窗口内立即正确地保存角色和推理。我们研究了当历史较长、具有误导性且角色重(角色逻辑干扰)时,此类智能体的逻辑部分会发生什么,并提出一种解耦架构 (AO-DA),它将逻辑推理(“什么”)与角色表达(“如何”)分离成一个带有热插拔 LoRA 适配器的 INT4 基础模型上的两条推理路径。逻辑路径仅接收核心转动并发出可验证的结构化状态(Micro-State);角色路径使其具有完整历史的特征。在 Apple M2 笔记本电脑(Llama-3.1-8B-Instruct 和 Gemma-3-4B-it,4 位;480 运行超过 4 个污染级别 x 3 个手臂 x 2 个任务 x 2 个角色 x 5 个种子)上的相同基础模型消融中,我们发现:(i)解耦逻辑路径在结构上对污染保持不变:其提示保持在 180(Llama)或 167 (Gemma) Token,而混合单遍提示从 242 增加到 1,203,并且其输出是字节相同的 跨级别(40/40); (ii) 混合单遍单调降级(Llama 上的复合逻辑得分为 0.669 到 0.150,Gemma 上的复合逻辑得分为 0.487 到 0.150),主要是由于未能发出所需的结构化输出(Llama 上的运行为 80-95%,Gemma 上的两个最高级别为 100%); (iii) 在将相同污染输入解耦逻辑路径的情况下,专用适配器、专用格式路径仍然比 8B 模型上的单次传递更稳健(失败 0-20% vs 80-95%;配对 $Δ$ +0.30 到 +0.50,Cliff 的 $δ$ 0.50-0.85,Holm 调整的 $p \le 0.03$),但不是在4B 模型,两者都崩溃了。分离会在主题的第一轮上花费一次额外的解码(Llama 上为 28.2 秒,Llama 为 18.2 秒),并在 1.7 毫秒内购买角色热交换,而无需重新运行逻辑路径。代码、标准、固定装置、适配器和日志均已发布。