论文
HMED:从修订结果蒸馏事后元经验
Learning from Revision Consequences: Hindsight Meta-Experience Distillation for Self-Improving Agents
摘要
随着智能体通过生成和修改技能不断改进,发现和完善这些技能的过程本身就成为一个可学习的对象。任务技能直接作用于任务执行,而元技能则控制智能体如何发现和改进未来技能;因此,它们的价值通过它们引发的后续搜索过程而显现出来。现有方法根据观察到的原始技能搜索轨迹和分支结果来改进元技能。然而,分支性能将初始发现状态和生成搜索过程的元技能修订版的影响纠缠在一起,使得很难描述特定修订版实际更改的内容,并将更新推向受益于有利状态的修订版,而不是改进流程的修订版。我们引入HMED(Hindsight Meta-Experience Distillation),这是一种构建自我改进智能体元体验的机制。 HMED 重新访问修订源自的已完成事件,并从同一恢复的发现状态重新执行现有和修订的元技能,以便可以在共享条件下观察与修订相关的更改。每次比较都会被提炼成元体验,这是一种可以在未来更新中重复使用的结构化记录,因此即使最终没有保留的修订仍然会提供学习信号。在三个交互式智能体基准以及开源和闭源模型中,HMED 在强大的基线上持续提高技能发现性能,将元技能学习从分支结果转向改变改进过程的后果。
