论文

面向大规模推荐解释的LLM-as-a-Judge生命周期

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

模型评测评测方法与指标

摘要

LLM-as-a-Judge利用一个大语言模型来评估另一个AI应用或模型生成的自然语言文本,已成为加速和扩展昂贵的人工评估的标准、可扩展方法。然而,大多数工作把评判模型视为静态工件,只在构建时或针对固定基准评估一次。我们主张,生产系统中的LLM评判模型更适合被理解为一个具有生命周期的实体:它必须随周边数据的演化而被构建、训练、部署和持续维护,每个阶段都有独特的技术与运营挑战。我们在Netflix评估推荐解释的LLM评判模型上呈现了这样一个生命周期。我们的管线每周生成、并由评判模型评估数十万条不同的剧集级解释,通过移动端体验呈现给数百万会员。我们的框架分四个阶段。(一)诞生:定义评估标准,并用人工标注与理由构建精选基准数据集。(二)训练:通过推理对齐的评分细则调优(RART)来细化评判模型的评分细则,该方法以一个对推理输出进行评判的元评判模型作为学习信号。(三)部署:让一个评判模型承担两种在线角色——质量门控和反思式生成。(四)监控:运行持续的人在回路(HITL)对齐流程,检测漂移并在人工审查门后触发重新调优。我们报告了在Netflix移动应用上覆盖数千万会员、为期五周的在线A/B测试结果:与评判模型对齐的解释使会员观看更多转向新内容(此前未看过的),并相对于无解释的对照提升了从浏览到成功播放的会话,且没有出现因质量问题而下架的情况。

面向大规模推荐解释的LLM-as-a-Judge生命周期:论文配图
图1. 用于推荐解释的LLM裁判的四阶段生命周期。(I) 诞生(§4):构建一个由人工标注、附带理由注释的样例组成的基准,并划分为训练/验证/测试集。(II) 训练(§5):一个反思器LLM根据裁判与人工在标签及推理上的不一致来调整每个准则的评分细则,直到验证指标通过。(III) 部署(§6):裁判对生产环境中的解释进行把关,并通过有界重试驱动自反思式修订。(IV) 监控(§7):每周对人工评分的样本进行检测以发现裁判与人工之间的漂移,并用于扩充基准;当漂移超过阈值时重新触发(II)。四阶段循环图。阶段I从专家手工构造的样例、LLM合成的边界样例以及抽样得到的生产环境解释中构建人工标注的基准数据集。阶段II用反思器LLM和推理元裁判调整每个准则的评分细则。阶段III将调优后的裁判作为护栏部署到生成-裁判-修订循环中,对每条解释要么提供要么丢弃。阶段IV每周抽样已提供和被拦截的解释供人工复核,比较裁判与人工标签,当漂移超过阈值时重新触发阶段II。