论文

主动Agent的基础:原理、技术层和 Proactivity-Gym

Foundations of Proactive Agents: Principles, Technical Layers, and Proactivity-Gym

智能体系统Agent HarnessAgent任务评测

摘要

主动的 LLM Agent可以在用户提出要求之前将空闲计算转化为有用的支持。然而,即使正确的工作也可能会误读用户上下文、增加审核成本或破坏信任。这项工作为围绕三个联合原则(3T)设计、实现和评估主动的 LLM Agent奠定了基础:任务能力、预测相关需求和正确执行有用的工作;时间分配,根据资源可用性和何时需要结果来分配计算;信任,维持用户对Agent的信心和适当的依赖。我们将这些目标连接到围绕五个维度组织的设计空间:任务范围、预期范围、激活触发器、处理时间和干预深度,并指定支持其选择所需的情况和系统建模,包括用户和环境表示、骨干大语言模型和Agent Harness。最后,我们提出了 PROACTIVITY-GYM,一个基于模拟的评估测试平台,包括多天场景、状态环境和角色条件模拟用户,可以评估跨交互的主动协助的后果。对 23 种模型Harness配置的评估揭示了 3T 之间的巨大性能差距,并表明大语言模型评委经常将任务能力和信任混为一谈。一项针对 30 名参与者的用户研究证明了联合 3T 优化的重要性:尽管结果正确,但在干预错位后,参与者表现出信任度急剧下降,并且更喜欢空闲时段辅助(sleep-time assistance),即使不完美,以保持持续的注意力。总之,这些发现支持通过共同考虑有用的工作、计算分配和不断发展的用户信任来设计和评估主动Agent。

主动Agent的基础:原理、技术层和 Proactivity-Gym:图2:主动研究工作流中的3T目标。晚上9点,用户忙于运行主要实验,Agent发现缺少消融实验和执行摘要。为避免争用算力并打扰用户专注,Agent将主动工作推迟至用户睡眠、GPU可用时(TA)。睡眠期间,它运行并核验消融实验,起草摘要(TC)。Agent将消融结果加入附录,并在截止期限前的下一次交互中提交摘要供用户审阅(TA),符合用户对介入深度的偏好(TR)。
图2:主动研究工作流中的3T目标。晚上9点,用户忙于运行主要实验,Agent发现缺少消融实验和执行摘要。为避免争用算力并打扰用户专注,Agent将主动工作推迟至用户睡眠、GPU可用时(TA)。睡眠期间,它运行并核验消融实验,起草摘要(TC)。Agent将消融结果加入附录,并在截止期限前的下一次交互中提交摘要供用户审阅(TA),符合用户对介入深度的偏好(TR)。