训练代理通过他们的装备不断发展:TaoLive 数字化身代理技术报告
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
摘要
由人工智能驱动的数字化身主播必须实时回答产品问题、吸引观众并执行营销策略,要求低延迟、频繁的策略更新以及准确而有效的响应。 Evolvable Harnesses 的技能、Hooks、提示和工具可以独立于模型权重进行更新,可实现快速迭代,但也存在一个权衡:大型模型适应零样本但速度太慢,而紧凑模型满足延迟目标但过度适应固定 Harness 配置。我们提出了Harness感知训练(HAT),它可以训练紧凑的模型以适应不断变化的Harness。其关键组件 Harness-State Augmentation (HSA) 将任务保留转换应用于技能标识符和内容、工具模式、提示结构和 Hook 函数。训练分三个阶段进行:HSA-SFT 从不同环境中的强模型轨迹中学习推理和工具使用;通用 同策略 蒸馏 恢复 SFT 期间丢失的泛化能力; HSA-RL 通过增强环境中的强化学习提高了对不断变化的Harness的鲁棒性。在四个评估集上,HAT 在 Live-Stream QA 上取得了 94.8 分(基础值:80.3;最强通用 LLM:93.0),在 Harness-Variant QA 上取得了 94.6 分(基础值:75.4)。与固定Harness SFT 不同,固定Harness SFT 将 IFEval 比基本模型降低了 7.7 个点,而 HAT 避免了这种回归并达到 83.5。在一个 NVIDIA H20 GPU 上,优化后的系统可提供 3.4 秒和 8.1 秒的 P50 和 P95 延迟。它部署在淘宝直播的数字化身服务中,还为商品页面浏览量提供了积极的在线 A/B 测试结果。