论文

从逐用户到交易模式:银行规模的语义用户画像流水线

From "Who Is This User?" to "What Does This Purchase Mean?": A Deployed Pipeline for Semantic User Profiling at Bank Scale

AI 基础设施推理服务

摘要

对每个用户的交易历史分别进行LLM推理,使推理预算随用户数量线性增长,在应用规模下可能难以承受。我们将属性推断从逐用户改写为逐交易模式。流水线分三个阶段:Resolve对商品名称进行抽象,并可选地使用网页证据;Profile为每个高频模式推断属性;Tag将自由文本属性聚类成可查询数据库。在Profile阶段,每个模式只需一次LLM调用,即输出预定义类别标签、自由文本属性和各属性的流行程度估计。由于推理围绕模式而非用户执行,预算随模式数而不是用户数增长。在公开Open电子商务语料上,对所评估属性而言,该数据库的AUC与直接读取每名用户原始历史的LLM在统计上不可区分,流行程度估计也包含区分正负用户的信号。流水线已在日本一家大型银行部署,为数千万量级用户生成画像;与逐用户流水线相比,LLM推理对象数减少近三个数量级。代码可通过文中链接公开获取。

从逐用户到交易模式:银行规模的语义用户画像流水线:论文配图
图1:逐用户画像与逐交易模式画像比较。传统方法为每位用户调用一次LLM;新方法分三阶段:Resolve抽象商品名并可选联网佐证,Profile联合输出人口、心理行为及人生事件三类闭集标签、自由文本属性与属性先验,Tag在各类别内聚类自由属性并命名标签,形成可按标签查询的属性库。图中为清晰起见仅展示单商品模式的自由文本路径;闭集标签来自同一Profile输出,多商品模式采用相同表述。