开源项目
Hermes Warm Compaction 复用主模型缓存生成上下文交接
Hermes Agent context engine: the main model writes the compaction handoff on its cached prompt prefix
概述
Warm Compaction 是适配 Hermes Agent 的上下文引擎插件,Apache-2.0 许可,需保留 NOTICE。它通过公开插件接口捕获上一主模型请求,在其完整消息前缀后追加新增行和交接指令,再用摘要替换较早历史并保留近期原文。主路径需 OpenAI-compatible chat completions、相同模型路由及服务器前缀缓存;Hermes 至少为 45871e10,Python 至少3.10。容量不足、路由变化或摘要门控失败时转辅助摘要,再失败用固定格式,取消时不改历史。安装插件、启用并将 context.engine 设为 warm_compaction 后开启新会话。仓库披露在未修改 Hermes、十个100K以上token合成会话、DGX自动压缩比较中:压缩中位数16.8秒,相比 hermes-lcm 43.5秒和内置78.5秒;压缩加下一回答为27.9、66.1、97.1秒,保留关键事实59/60、43/60、50/60。测试只有一个任务族和会话形状,初始化历史没有工具行,LCM因隔离条件使用字符估计计数;不同摘要路线和上下文截断也影响结果。数据是作者诊断,未证明通用生产质量;LM Studio未报告cached_tokens,不能由更快反推缓存命中。