技术实践

美团用GeoRA低秩适配训练业务Agent

模型训练智能体系统强化学习参数高效训练Agent 架构与控制循环Agentic RL

概述

美团履约平台技术部在真实业务的 Agentic RL(RLVR)训练中落地自研的 GeoRA 低秩高效微调方法。出发点是业务 Agent 模型需要大参数量与长上下文、强化学习开销可观,而业务增量知识与能力规模不大、低秩容量足以承载;团队在对比 LoRA、PiSSA 等典型低秩方法后确认 RLVR 的训练动力学与 SFT 不同(RLVR 更新稀疏区域而非稠密大规模更新),且直接做稀疏微调因 GPU 对非结构化稀疏计算不高效、实测单步耗时比全参数还涨 10.8%,最终采用「几何定位 + 低秩压缩」的 GeoRA 方案,用稠密低秩矩阵逼近 RLVR 的稀疏更新子空间。在真实业务 Agentic RL 中应用后,GeoRA 仅用不到全参训练一半的资源,取得了优于全参训练和 LoRA 的效果。