论文

Macaron-V1:通过自我完善和 LoRA 混合迈向开放式持续学习

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

智能体系统Agent 架构与控制循环

摘要

Macaron-V1 是一个开放的体验式智能代理模型系列:从真实环境中的经验中学习并在部署后继续学习。它是围绕两个系统目标组织的。通过版本化模型-工具对的递归改进来实现适应,其中一种配置的经验在外部合同下进行评估并用于构建其后继者。通过 LoRA 混合 (MoL) 架构来实现协作,该架构冻结基本模型、组成专业 LoRA 适配器,并为每个用户回合选择一个 LoRA。旗舰 Macaron-V1-Venti (748B) 将 744B GLM-5.2 底座与四个用于聊天、代理、编码和 GenUI 的 LoRA 相结合;基于Qwen3.6-35B的Macaron-V1-Tall(50B)采用相同的设计进行本地部署。本报告将 Macaron-V1 介绍为跨架构、算法和基础设施的共同设计系统。 MoL 架构支持通过可扩展的 LoRA 专家进行持续学习。该算法结合了模型-Harness协同设计和递归自我改进循环,包括 UI4A 组件原生 GenUI Harness、有状态操作基底、版本化Harness上下文协议合约和代理 RL 框架 MindForge。支持基础设施包括 后训练 平台 MinT、长上下文 RL 方法 LongStraw 以及稀疏 MoE 和 DSA 基础模型的稳定性技术。我们根据个人智能、GenUI 和前沿基线的通用能力基准评估 Macaron-V1。我们的结果验证了当前的系统,而持续学习和集体智慧的复合收益仍然是一个悬而未决的问题。