论文

释放 大语言模型 的潜力:实时、企业就绪部署的蓝图

Unleashing the Potential of Large Language Models: A Blueprint for Real-Time, Enterprise-Ready Deployments

AI 基础设施AI 开发与运维平台

摘要

部署在实时、受监管的环境中的 大语言模型 面临知识陈旧、灾难性遗忘、幻觉和弱反馈循环的问题。我们提出了一种统一的、模式驱动的 LLMOps 架构,将实时数据摄取、持续学习、检索增强生成 (RAG) 和人机交互反馈集成到单个操作管道中。四个贡献映射到已建立的软件设计模式:使用 FreshStreamBench 评估的自适应摄取模式编排器 (AIPO); STAR+FAR 持续学习,具有稀疏时间适配器路由和新鲜度感知重放; SAGE,一种 SLO 感知自适应检索策略,可预测每个查询的通道预算以满足尾部延迟目标;以及带有 RLHF 触发器的自动反馈驱动收敛阶段。结果减少了延迟-成本-准确性权衡,同时支持医疗保健和金融等高风险行业的可审计性和回滚。