论文
GenZ:基础模型作为传统统计模型中的潜变量生成器
GenZ: Foundational models as latent variable generators within traditional statistical models
摘要
我们提出 GenZ,一个通过可解释语义特征桥接基础模型与统计建模的混合模型。大语言模型虽具备广泛的领域知识,但往往无法捕捉对预测任务至关重要的数据集特有模式。我们的方法通过一个迭代过程发现语义特征描述:该过程对由统计建模错误识别出的条目组进行对比,而不是仅仅依赖基础模型的领域理解。我们将其形式化为一个广义 EM 算法,联合优化语义特征描述符与统计模型参数。该方法提示冻结的基础模型依据所发现的特征对条目分类,把这些判断视为潜二元特征的含噪观测,这些潜特征再通过学习到的统计关系预测实值目标。我们在两个领域展示该方法:房价预测(hedonic regression)和电影推荐的冷启动协同过滤。在房价上,我们的模型利用从多模态房源数据中发现的语义特征取得 12% 的中位相对误差,大幅优于依赖 LLM 一般领域知识的 GPT-5 基线(38% 误差)。对于 Netflix 电影嵌入,我们的模型纯凭语义描述就以 0.59 的余弦相似度预测协同过滤表示——这相当于传统协同过滤需要约 4000 个用户评分才能达到的性能。所发现的特征揭示了数据集特有的模式(例如预测本地住房市场的建筑细节、预测用户偏好的连锁品牌归属),这些模式不同于模型仅凭领域知识所能得到的结果。
