技术实践

美团骑手招聘Agent以GeoRA进行强化学习训练

模型训练应用与实践强化学习参数高效训练行业应用Agentic RL

概述

美团履约技术团队把 GeoRA 用在 AI 骑手招聘 Agent 的 Agentic RL 训练上:该 Agent 主动触达并跟进候选人,在多轮沟通中识别其意愿、顾虑与决策卡点并针对性制定下一步策略,把候选人推进到面试与入职,目标与结果明确可验证(约面/入职/ROI)。该垂直场景有两个特点:一是基模大、单条轨迹上下文长,RL 资源开销可观。 二是增量能力规模不大、训练数据量远小于基模,低秩适配容量足够承载。业务训练中先观察到 LoRA、PiSSA、MiLoRA 效果差异明显、学习率调大就不稳甚至崩掉,由此提出为 RLVR 重新设计低秩先验。落地效果:与全参训练相当,相比 LoRA 提升约 12%。效率与 LoRA 相当,显存相比全参训练降低 54%,配合 QLoRA 等量化方法可进一步降低。 工程经验两条:一次性 SVD 初始化可用随机 SVD 加速,72B 模型处理不到 1 分钟。利用「初始化时函数不变」性质,在 actor 内保留一份冻结的初始低秩适配器即可现算参考策略,省去 RLVR 参考模型的完整权重存储。