论文

KuaFu:面向十亿用户的行为上下文压缩

KuaFu: Compressing Long User Behavior into Understanding at Billion Scale

上下文与知识上下文工程

摘要

会话代理、生成推荐器和个性化广告都依赖于一种能力:从原始行为中了解每个用户。普遍的工业实践是特定于任务的:对于每项任务,都会从完整的历史记录中提取相关的子序列并对其进行训练的专用模型。在生产中它遇到两个瓶颈。首先,即使在过滤之后,单任务序列仍然非常长:内容兴趣摘要会读取每个用户的数百个项目,一旦序列化为提示文本,就会有数万个 Token。其次,用户画像会定期更新:每周有 10 亿用户,总计大约 100K QPM,这在固定的 GPU 预算下设定了硬吞吐量下限。因此,压缩是强制性的,但截断或粗略压缩可能会悄悄地扭曲用户画像,引入四种幻觉类型(捏造、遗漏、日期错误归因、破坏逻辑),这些幻觉类型无法评估压缩表示本身,只能表现为下游指标中的扩散退化。我们提出了 KuaFu,一个统一的行为压缩层,其最小单位是一个行为项。两轴投影层将每个项目压缩为 2-4 个宽度为 128-256 的Token(沿Token轴约 10 倍,沿宽度约 20 倍;每项缓存 10 KB 至 0.5 KB),并进行面向保真度的四阶段训练和分层中间评估。在四个生产分析任务中,它在所有五个主要指标上都匹配或超过了未压缩的单任务生产模型,将每个 GPU 的吞吐量提高了 37%-350%,并节省了 190 个 GPU。在公共基准测试中,它几乎总是以相同的压缩比击败先前的压缩器(在域外 MRQA 上高达 +17.7 EM);在 RecBench 上,4B 模型比 8B 模型高出 1.90 分。夸父在腾讯广告推荐平台上线十个月,整体GMV提升1.37%。