论文
反欺诈与反洗钱LLMOps再思考:构建合规级LLM服务栈
Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack
摘要
欺诈检测与反洗钱(AML)合规是大语言模型(LLM)的高价值应用领域,但其服务需求与通用聊天负载截然不同。合规提示往往前缀繁重、受模式约束且证据丰富,组合了可复用的政策指令、风险分类体系、交易或文档上下文,以及JSON标签或风险因素等简短结构化输出。这些特性使前缀复用、KV缓存效率、运行时调优、模型编排与输出校验成为一等重要的系统问题。本文引入一个面向欺诈与AML负载的负载感知LLMOps栈,使用Meta Llama与Alibaba Qwen等自托管开源权重模型。该栈结合了vLLM风格的运行时调优、PagedAttention、自动前缀缓存、多适配器服务、感知适配器与提示长度的批处理、休眠/唤醒生命周期管理、投机解码,以及可选的prefill/decode分离。为避免暴露机构特定数据,可复现性路径将公开合成AML数据集(包括IBM AML与SAML-D)转换为前缀繁重的合规提示,其中包含可复用的政策文本、交易证据、类型学定义与模式约束输出。我们还纳入了LLM-as-judge质量门,结合确定性合规检查、参考指标、可用时的专家裁定校准数据,以及多评审rubric评分。在公开合成AML负载与受控服务基准上,负载感知调优将吞吐量从612-650提升至3,600请求/小时,P99延迟从31-38秒降至6.4-8.7秒,GPU利用率从12%提升至78%。这些结果表明,受监管场景下的LLM性能是一个负载设计、服务优化与质量门控问题,而不仅是模型选择问题。