论文
PRISM:面向企业对话式AI的迭代仿真与监控式提示可靠性保障
PRISM: Prompt Reliability via Iterative Simulation and Monitoring for Enterprise Conversational AI
摘要
在企业环境中部署大语言模型(LLM)驱动的对话式智能体,要求提示词在上线时即正确,并能抵御生产级LLM部署所特有的非确定性行为漂移。现有提示词优化框架将提示词质量视为一次性的编译期问题,搁置了同样关键的问题:如何检测并修复由LLM随时间悄然发生的行为变化所导致的提示词退化。我们提出PRISM(通过迭代仿真与监控保障提示可靠性),一个闭环框架,它将提示词工程视为持续的可靠性工程问题,而非一次性的撰写任务。PRISM以自然语言描述的智能体需求、一组已配置的工具与记忆变量以及初始草稿提示词作为输入。它从需求自动生成测试用例,在与平台行为一致的LLM环境中模拟完整的多轮对话,用LLM作为评判者评估通过与否,诊断失败的根因,并对提示词进行精准修复——迭代直到所有测试通过。关键在于,PRISM被设计为按计划(每日)运行,将LLM行为漂移作为一等可靠性问题对待。我们在Yellow.ai V3平台上,对35个企业对话式智能体进行了为期三周的部署评估。PRISM将提示词撰写时间中位数从2天缩短到30分钟以内,在所有被评估智能体上达到99%的生产可靠性,并能在24小时检测窗口内成功识别并修复由LLM行为漂移引起的生产退化。我们的结果表明,持续、仿真驱动的提示词优化,对于大规模可靠的企业对话式AI既是可行的,也是必要的。