论文

面向资源受限代理式语言模型的分层提示域控制与学习

Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models

智能体系统Agent 架构与控制循环

摘要

大语言模型越来越多地被部署在代理式系统中,它们必须遵循结构化协议、适应不断演变的状态,并在内存、延迟和成本约束下运行。在这种情形下,提示扩展并不可靠:不断增长的上下文会把紧凑模型推出其有效提示域,而部署时微调仍受限于稀缺的数据和算力。我们提出一个分层控制与学习框架:先通过蒸馏让紧凑模型学习所需的输出模式(schema),再由 oracle-控制器回路对其进行在线监督。控制器监控协议有效性与语义性能,把累积的历史投影到可行的提示域中,并在漂移时触发轻量的 oracle 监督微调。这将用于通信兼容性的模式学习与用于任务级纠正的语义适配分离开来。我们形式化了提示域可行性与注意力诱导的饱和,论证应控制有效提示状态,而非依赖名义上下文长度。以多保真贝叶斯优化作为受控的序列测试床,我们刻画了一种核心部署失效模式,并展示了相对非分层、仅蒸馏和非蒸馏基线的可靠性与成本效率提升。

面向资源受限代理式语言模型的分层提示域控制与学习:论文配图
(a) GPT-5 与 Llama-3.1-8B(b) Distilled Llama-3.1-8B(c) Llama-3.1-8B(d) GPT-5 与 Mistral-7B(e) Distilled Mistral-7B 图 2:表 4 所示消融研究中每个考虑模型获得的结果的可视化。真实参照模型以黑色显示,近似模型显示为彩色虚线:红色、黄色、绿色和紫色分别对应保真度级别 1、2、3、4。用蓝色表示使用每个模型获得的近似值及其不确定性区域。