论文
CLAP:领域Agent后训练的闭环训练评估与发布控制
CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training
摘要
领域智能体常面临嘈杂业务数据、不确定的后训练增益、离线/应用失配与适配器发布风险。本文提出CLAP(闭环智能体后训练)——闭环方法——将业务数据转化为结构化SFT样本、决策偏好样本、留出集、风险诊断与发布门记录。CLAP组合数据验证、目标/证据归一化、奖励/KL诊断、离线门与应用链重放——判断适配器是否适合目标应用链。在五个匿名化制造场景批次上——QLoRA式LoRA-SFT产生温和的平均增益:总分提升0.0098、通过率提升0.0240、证据准确率提升0.0280——幻觉与错误事实减少。但仅5个批次中3个改善——部分批次退化——且GRPO暴露高KL风险。应用链重放进一步表明RAG对事实抽取是必要的;在相同3B骨干与100个重放案例下——面向应用RAG的LoRA-SFT适配器较base+RAG改善取值、核心字段与答案-证据文档/页匹配——但增加延迟。这些结果支持经集成的数据-训练-评估-发布循环管理领域智能体后训练——而非依赖训练完成或单一离线分数。
