论文

Echo:通过用户驱动的精修从经验数据中学习

Echo: Learning from Experience Data via User-Driven Refinement

模型训练持续学习

摘要

静态的“人类数据”存在固有局限:扩展成本高昂,且受制于其创建者的知识。从“经验数据”——智能体与其环境的交互——中持续学习,有望超越这些障碍。如今,AI智能体的广泛部署使我们能以低成本获取海量此类真实世界经验流。然而,原始交互日志天然含噪,充满试错且信息密度低,直接用于模型训练效率低下。我们提出Echo,一个通用框架,旨在把“从原始经验到可学习知识”的转变付诸实施,有效地将环境反馈像回声一样送回训练循环以优化模型。在当今的智能体生态中,用户精修是此类反馈的主要来源:出于对结果的责任感,用户会严格地把有缺陷的智能体提案转化为经验证的解决方案。这些用户驱动的精修序列天然地把智能体的粗糙尝试蒸馏为高质量训练信号。Echo系统性地收集这些信号,使智能体持续对齐真实世界需求。在生产级代码补全环境中的大规模验证证实,Echo有效利用了这一流水线,把接受率从25.7%提升到35.7%,突破了静态性能上限。

Echo:通过用户驱动的精修从经验数据中学习:论文配图
图 1:范式转变:从静态档案到交互式体验。传统训练依赖于有限的人类数据和专家注释(左)。 Echo 框架(中)通过持续的、用户驱动的改进打破了这个静态天花板。提炼这些用户修正可以将代理扩展到开放式一般体验时代(右)。