论文

GenZ:基础模型作为传统统计模型中的潜变量生成器

GenZ: Foundational models as latent variable generators within traditional statistical models

应用与实践结构化分析、预测与决策

摘要

我们提出 GenZ,一个通过可解释语义特征桥接基础模型与统计建模的混合模型。大语言模型虽具备广泛的领域知识,但往往无法捕捉对预测任务至关重要的数据集特有模式。我们的方法通过一个迭代过程发现语义特征描述:该过程对由统计建模错误识别出的条目组进行对比,而不是仅仅依赖基础模型的领域理解。我们将其形式化为一个广义 EM 算法,联合优化语义特征描述符与统计模型参数。该方法提示冻结的基础模型依据所发现的特征对条目分类,把这些判断视为潜二元特征的含噪观测,这些潜特征再通过学习到的统计关系预测实值目标。我们在两个领域展示该方法:房价预测(hedonic regression)和电影推荐的冷启动协同过滤。在房价上,我们的模型利用从多模态房源数据中发现的语义特征取得 12% 的中位相对误差,大幅优于依赖 LLM 一般领域知识的 GPT-5 基线(38% 误差)。对于 Netflix 电影嵌入,我们的模型纯凭语义描述就以 0.59 的余弦相似度预测协同过滤表示——这相当于传统协同过滤需要约 4000 个用户评分才能达到的性能。所发现的特征揭示了数据集特有的模式(例如预测本地住房市场的建筑细节、预测用户偏好的连锁品牌归属),这些模式不同于模型仅凭领域知识所能得到的结果。

GenZ:基础模型作为传统统计模型中的潜变量生成器 配图
图 3:房源列表图片(左)及相应的 MLLM 生成的语义条目(右)。带删除线的价格表示在我们模型的训练中,条目 s 的价格被隐去。然而,在我们方法的对照方案中,包括价格在内的所有条目都被纳入基线提示:将整个数据集交给 GPT 5,要求其生成对价格具有预测力的特征。