论文

主动代理是否需要 LLM 来决定何时采取行动?

Do Proactive Agents Need an LLM to Decide When to Act?

智能体系统Agent 架构与控制循环

摘要

积极主动的助理不断决定何时进行干预以及什么背景应该支持干预。 大语言模型 (LLM) 管道反复解释活动历史来做出这些决策,即使助手保持沉默,也会付出推理成本。我们证明了一个小图模型可以处理这两种决策并改进它控制的语言代理。我们的主要见解是,用户活动具有本机图形结构:事件涉及持久实体,这些实体随着时间的推移重复连接交互。触发和上下文选择直接映射到事件和实体节点的预测。我们引入了一种时间图学习(TGL)控制器,它联合学习这些预测并在一次前向传递中提供两个输出。下游语言代理使用活动历史记录和评分实体生成有关触发事件的建议。 GPU 服务器上每个事件的时间为 11.13 毫秒,TGL 在九个触发架构中实现了最高的 AUC,并且比两个单前向 LLM 触发器提供了大约 $4$-$7\times$ 触发级加速。共享 TGL 模型将所有 14 个下游骨干网的 F1 平均提高了 16.7 个点。该控制器还在消费类笔记本电脑上以 13.99 毫秒的速度运行,占用空间约为 220 MiB BF16,为设备上的部署带来有效的主动控制。