论文
神经符号计算机的使用:学习可重复使用的策略以实现可靠和高效的执行
Neuro-Symbolic Computer Use: Learning Reusable Policies for Reliable and Efficient Execution
摘要
许多计算机任务会重复出现:相同的工作流程会使用新的输入并从不同的起始状态运行多次。当前的计算机使用Agent会重新计划每次运行的每一步,这使得它们在执行此类任务时成本高昂且不可靠。我们引入了神经符号计算机的使用,其中循环工作流程由学习的策略执行,而不是由Agent在每次运行时重新派生。该策略修复了可执行代码中跨运行(排序、变量、循环和分支)稳定的决策,并将依赖于观察的决策(例如基础和状态检查)委托给神经模型。我们通过神经符号策略迭代来学习这些策略:从一个Agent轨迹开始,它执行策略,通过任务完成和步骤级判断来诊断故障,并使用Agent从故障点继续进行的编码模型来修改代码,而无需访问基准评估器。迭代生成的参数和初始状态变体使策略可重用,并且预操作验证器在部署时保护每个状态突变步骤。在 OSWorld-Verified 和 ScienceBoard 上,学习策略在所有四种设置中实现了所有方法中最高的 Pass^3,比基础Agent高 3.6-15.8 个点,同时将每次运行成本降低了 15-217$\times$,将延迟降低了 3.4-5.1$\times$。在 OSWorld-Verified 上,仅基于变体构建的策略转移到保留的原始任务,在 Pass^3 中超过 AutoRPA 8.6-17.5 个点。