论文

HEAR:让智能体Harness与推理引擎双向交换工作流和运行状态

Can Agent Harnesses and Inference Engines Hear Each Other? The HEAR Protocol for Agentic LLM Serving

智能体系统智能体互操作协议

摘要

LLM智能体越来越多地执行包含多轮推理、工具使用和并行智能体的复杂工作流。高效服务需要横跨两个具有互补信息的层次进行决策:智能体Harness理解工作流依赖、上下文生命周期和执行目标;推理引擎则观察请求队列、KV缓存状态、资源压力与执行能力。现有接口没有系统地连接这两种视角,限制了感知工作流的执行。HEAR是面向Agentic LLM服务的双向Harness—引擎配对协议。它标准化Harness如何传达工作流意图和执行要求,以及引擎如何返回运行状态、能力和结果。通过分离协议语义与优化策略,HEAR无需改变工作流或模型语义,即可支持多种协调策略。我们实现了两类应用:在线缓存感知运行协调,以及根据工作负载为智能体角色选择执行模式。在内存受限、并发服务条件下的四项对话与研究智能体基准中,HEAR在SCBench上实现$1.61\times$批次加速,并将首token延迟中位数降低$2.23\times$。Mooncake实验表明,工作流意图与实时引擎状态在不同负载区间提供互补收益。在BrowseComp-Plus和DeepResearchBench上,针对工作负载配置分别实现$1.23\times$和$2.45\times$端到端加速,且未观察到任务质量下降。这些结果表明,HEAR可作为高效Agentic LLM服务的可复用协调基础。

HEAR:让智能体Harness与推理引擎双向交换工作流和运行状态的原论文方法或结果图
图1:提出协议的示例。缺少工作流意图时,引擎可能在KV状态即将复用之前将其驱逐;缺少KV驻留反馈时,Harness可能先调度冷缓存请求,后调度等效且缓存已驻留的请求。