技术实践

得物客服从单Agent演进为跨场景Harness

智能体系统模型训练上下文与知识模型优化模型评测应用与实践监督微调与指令调优偏好优化强化学习奖励建模与过程监督上下文工程记忆Agent 架构与控制循环Agent 工具调用Agent 协作Agent 动作执行与治理Agent Harness智能体互操作协议蒸馏模型能力评测通用理解与问答RLVRAgentic RLAgent记忆MCP

概述

得物智能客服因传统「意图分类 + NER + 对话管理 + FAQ 召回 + 重排」流水线无法处理多步骤任务、SOP 人工维护成本高、多套小模型分头部署运维成本高、会话拟人度不足,改造为 Agent 架构并经历三阶段:第一阶段为基于 Qwen 的 Single-Agent(单 Prompt),暴露 Prompt 过长导致指令遵循能力有限、串行 Pipeline 无法实现 Agent 多轮 ReAct 两个问题;第二阶段采用 AutoGen 的 Multi-Agent 架构做渐进式披露,拆出总控 Agent(任务调度与流程管控)、出话 Agent(生成最终回复话术)、评估器 Agent(实时评估输出质量)、润色 Agent(提升自然度与拟人感),通过 SelectorGroupChat 模式实现动态调度,正文称解决率提升明显但未给具体数字;第三阶段为解决跨场景复用进一步演进到 Harness 架构,具备跨会话 Memory(用户历史上下文记忆)、上下文压缩与轨迹压缩、总控 Agent 管理以提高回复可控性、数据飞轮驱动模型持续优化,Skill 自动化生成标注为进行中。配套的高可控性 PE 自动化流水线用 LLM 抽取转人工 case 中的 Agent 回复(Bad)与人工回复(Good)做对比数据抽取,由 LLM 分析 Prompt 修改建议,经人工 Review 标注可行性、离线跑测同批数据后上线实验并持续优化,以替代时间成本高、易引发 Prompt 冲突与歧义的人工 Prompt Engineering。 得物智能客服为让 Agent 学会「正确决策」搭建了 RL 训练框架,分数据基建、模型训练、评测体系三大模块:数据基建侧采集线上反馈数据、用策略埋点构造 Multi-turn RL 训练数据,由专家模型生成决策理由进行 CoT-RL 训练,并以 MCP Server 部署实时 Tools 调用;模型训练侧采用 Cold-start SFT 预热,配合可验证的 Rule-Based-Reward 与生成式 Model-Based-Reward,用 GRPO 训练;评测体系由 LLM-as-a-Judge、人工评测与用户模拟器一致性评测三者组成,并通过优化 Reward、解决数据有偏、增加思考过程(CoT 训练)对抗 Reward Hacking。为避免 RL 训练带来灾难性遗忘,团队以 C-Eval、CMMLU 作为测试标准实时监控,并给出四条规避方法:降低学习率(全量训练 ≤ 5e-5)、通过 eval-step 实时监控通用基准指标、限制训练 2~4 epoch、控制数据比例(模型自推理与模型依赖 Tool 调用 = 1:1)。正文另列出消融实验(不同 epoch、不同 cold-start sft 底座、不同 lr)与业务干扰度消融实验(A 业务 / B 业务 / A+B 业务),但对比结果承载在图片中,正文未给出可读数字。 为补齐客服回复的拟人度与情感温度,得物建立了完整的百分制服务测评标准,并用三种训练模式协同完成人类经验对齐:CoT-RL 策略蒸馏用于蒸馏优秀客服的决策逻辑;DPO 话术蒸馏用于对齐对话语气、减少重复、规范表情包和称谓使用;表情模块做表情分类与语境分析,精细化控制表情使用时机,分类体系覆盖开场欢迎 / 积极开心 / 思考疑惑 / 抱歉安抚 / 提醒强调 / 期待等待 / 完成确认 / 正在努力 / 物流配送 / 价格优惠 / 对接售后 / 结束感谢共 12 类。同时通过 DPO 模型训练飞轮,利用 LLM-as-a-Judge 搜集回流数据并重新训练,构造 chosen 与 reject 样本训练润色模型,并训练「能否回复」「回复正确性」「是否拟人」三个判别模型。正文给出的对齐效果为模型评分接近 Top5% 优秀人工水平,但未给出百分制具体分值与人效对比样本量。 智能客服场景的消息收发具有不对称性:用户可随时发送消息(全双工、可打断),但 Agent 回复期间不应被打断(半双工、不可打断),用户→Agent 为全双工可打断,Agent→用户为半双工不可打断。为实现精准的消息合并/切分判断,得物拉取线上用户连续消息进行标注,用 LLM 对负样本做扩写完成数据增强,再基于 Qwen3-4B 做分类训练,得到专用分类模型用于多轮消息流控制。正文未给出该模型的准确率、上线时间与调用量。