论文
面向大规模推荐解释的LLM-as-a-Judge生命周期
The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations
摘要
LLM-as-a-Judge利用一个大语言模型来评估另一个AI应用或模型生成的自然语言文本,已成为加速和扩展昂贵的人工评估的标准、可扩展方法。然而,大多数工作把评判模型视为静态工件,只在构建时或针对固定基准评估一次。我们主张,生产系统中的LLM评判模型更适合被理解为一个具有生命周期的实体:它必须随周边数据的演化而被构建、训练、部署和持续维护,每个阶段都有独特的技术与运营挑战。我们在Netflix评估推荐解释的LLM评判模型上呈现了这样一个生命周期。我们的管线每周生成、并由评判模型评估数十万条不同的剧集级解释,通过移动端体验呈现给数百万会员。我们的框架分四个阶段。(一)诞生:定义评估标准,并用人工标注与理由构建精选基准数据集。(二)训练:通过推理对齐的评分细则调优(RART)来细化评判模型的评分细则,该方法以一个对推理输出进行评判的元评判模型作为学习信号。(三)部署:让一个评判模型承担两种在线角色——质量门控和反思式生成。(四)监控:运行持续的人在回路(HITL)对齐流程,检测漂移并在人工审查门后触发重新调优。我们报告了在Netflix移动应用上覆盖数千万会员、为期五周的在线A/B测试结果:与评判模型对齐的解释使会员观看更多转向新内容(此前未看过的),并相对于无解释的对照提升了从浏览到成功播放的会话,且没有出现因质量问题而下架的情况。
