论文
部署前测试:管理 LLM 供应链中的更新
Test Before You Deploy: Governing Updates in the LLM Supply Chain
摘要
大语言模型 (LLM) 越来越多地用作软件系统中的核心依赖项。然而,托管的 LLM 服务通过提供商端更新不断发展,无需显式版本更改。这些静默更新可能会引入行为漂移,导致功能、格式、安全约束或其他特定于应用程序的要求方面的回归。现有方法主要关注回归测试或版本控制,但不提供部署者端机制来在不透明模型演化期间控制兼容性。本文提出了一个基于三个组件的部署端治理框架:明确定义模型行为规则(生产合同)、按部署风险类别组织的集中测试(基于风险类别的测试套件)以及发布检查点,阻止更新,除非它们满足定义的安全和性能标准(兼容性门)。通过跨多个 LLM 版本的探索性验证,我们提供了证据,证明特定风险领域的针对性测试可以发现总体指标遗漏的性能回归。我们还确定了几个开放研究挑战,包括如何系统地构建有效的测试套件、如何在非确定性系统中设置可靠的性能阈值,以及当提供商提供有限的透明度时如何检测和解释模型漂移。总体而言,我们将 LLM 更新管理构建为软件供应链治理问题,并概述了将部署方兼容性控制付诸实践的研究议程。