论文
验证,不要信任:大规模视频发现检索的代理模型开发
Verify, Don't Trust: Agentic Model Development for Video Discovery Retrieval at Scale
摘要
大型语言模型 (LLM) 代理可以提出、实施和评估模型更改。自动研究循环通过对独立程序进行分钟级迭代来演示这种功能。相反,在线自动研究涵盖了异步系统、长达数小时的变体以及可能影响产品的长达数周的活动。当代码更改是无操作、数据窗口泄漏、评估器语义漂移或两个臂遍历不同的服务漏斗时,完成的运行仍然可以支持无效结论。我们推出了 EvoPilot,一种用于长期在线自动研究的人控方法。特定于角色的代理通过版本化的领域技能和类型化适配器执行每一轮。持久的记录保存实验和失败;确定性检查强制执行记录的课程。我们研究了一项为期 37 天的检索系统活动,该系统为 Video Deep Dive (VDD) 提供支持,这是一种在用户打开种子视频后发现后续视频的在线体验。该活动涵盖七个方向,并使用每小时刷新的数亿视频索引。早期的手动实验尚未证实交互头有什么好处。一项原始的自动研究尝试重新审视了方向,但错误地将线下命中率下降 22 个百分点归因于头部。然后我们推出了 EvoPilot。其人工门控验证将下降归因于先前存在的评估缺陷,该缺陷产生了 3,000 和 600 的输出深度。修复后,匹配比较测量出离线改进了 3.20 个百分点。研究后重放和突变测试拒绝无效比较,同时承认有效的对应物。持久状态恢复了中断的回合,并且工件重用避免了大约 5 个 GPU 小时。另外,一项为期 7 天的随机在线评估估计,良好搜索结果保留率 (GSRR) 的 VDD 部分相对增加了 0.66%。