论文

EvoClawBench:Agent可以从自己的运行中学习可重用的技能吗?

EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?

智能体系统Agent任务评测

摘要

现有的代理基准测试主要测试任务完成情况、工具使用或技能实用性,但没有隔离运行时是否可以将其自身运行的证据转换为可重用的技能,从而在创作开销后改进新的执行。我们引入了 EvoClawBench,这是针对重复的夹具支持任务的闭环技能学习问题的基准。 EvoClawBench 比较了没有技能的直接执行、执行前的 PreSkill 创作以及来自第一次运行证据的 PostSkill 总结以及随后的第二次执行。该套件包含 100 个任务和 502 个子问题,涉及编码、数据、办公、安全、操作和域文档工作流程,并支持多个代理运行时。在本地执行下使用 OpenClaw 和 Nanobot 进行的实验表明,直接基线性能强烈依赖于运行时:OpenClaw 在各个模型中保持在 20% 以下,而 Nanobot 的范围从 56.45% 到 96.13%。自创技能的效果好坏参半。纳米机器人 GPT-5.4 在所有模式下都保持在 96% 以上,MiniMax-M2.7 在 PostSkill 下从 90.97% 提高到 94.50%,但纳米机器人 DeepSeek-V4-Pro 在 PreSkill 下从 77.77% 下降到 4.80%,在 PostSkill 下从 0.99% 下降。 OpenClaw 表现出类似的非单调行为,一些技能接近基线,而另一些则崩溃。这些结果表明,从代理自己的运行中学习可重用技能是有选择性的且对成本敏感,而不是向代理循环添加技能创作的自动好处。