论文
Steve-Evolving:通过细粒度诊断和双轨知识蒸馏实现开放世界的自我进化
Steve-Evolving: Open-World Embodied Self-Evolution via Fine-Grained Diagnosis and Dual-Track Knowledge Distillation
摘要
开放世界的具体代理必须解决长期任务,其中主要瓶颈不是单步规划质量,而是交互体验的组织和演变方式。为此,我们提出了 Steve-Evolving,一种非参数自进化框架,它将细粒度执行诊断与双轨知识蒸馏紧密耦合在闭环中。该方法遵循三个阶段:经验锚定、经验蒸馏和知识驱动的闭环控制。具体来说,体验锚定将每个子目标尝试固化为具有固定模式(前状态、动作、诊断结果和后状态)的结构化体验元组,并将其组织在具有多维索引(例如条件签名、空间哈希和语义标签)的三层体验空间中,加上滚动摘要以实现高效且可审计的召回。为了确保足够的归因信息密度,执行层提供了二元结果之外的组合诊断信号,包括状态差异摘要、列举的故障原因、连续指标和停滞/循环检测。此外,经验蒸馏的成功轨迹被概括为具有明确先决条件和验证标准的可重用技能,而失败则被蒸馏为可执行的护栏,捕获根本原因并禁止在子目标和任务粒度上进行危险操作。此外,知识驱动闭环控制检索的技能和护栏被注入到LLM规划器中,诊断触发的局部重新规划在线更新主动约束,形成持续演化过程,无需任何模型参数更新。在《我的世界》MCU 长视野套件上进行的实验表明,与静态检索基线相比,取得了一致的改进。
