论文
TeleTune:通过离线遥测不断发展智能体技能
TeleTune: Evolving Agent Skills From Offline Telemetry
摘要
计算机使用智能体需要捕获人们如何使用软件的程序知识。用户遥测提供了这种知识的可扩展来源。然而,从这些日志中学习可重用的技能需要解决三个挑战:(1)目标不明确,因为日志不记录每个操作背后的目标; (2) 不可重播性,因为无法重播过去的活动来评估技能更新; (3) 交错轨迹,因为日志可能会混合多个任务而不标记其边界。为了解决这些问题,我们引入了 TeleTune,这是一个从离线日志中学习文本技能库的框架,没有记录目标,在优化期间无法重播,并且可能会交错任务。 TeleTune 使用记录轨迹上的动作预测错误来建议库编辑,并仅保留那些提高留出动作预测准确性的内容,我们称之为技能引导的进展。学习到的工作流程还可以检索涵盖新任务子目标的演示。在测试时,智能体提供了学习库和基于工作流程的检索演示。 WorkArena 和 Online-Mind2Web 上的实验表明,TeleTune 的性能优于随机检索、智能体工作流程记忆 (AWM) 及其组合。我们发现最佳基线因设置而异,而 TeleTune 的平均成功率分别为 77.1% 和 80.6%,在每个基准上比最强基线提高了 6.7% 和 7.7%。在WorkArena 训练数据的最严重扰动下,TeleTune保持最高平均成功率68.5%,比最强基线高出6.3%。我们的分析显示 (1) 技能优化和基于工作流程的检索是互补的,(2) 固定日志优化的token成本比使用实时回合验证相同编辑的成本低 5 到 75 倍,(3) 技能引导的进度跟踪实时成功率。
