论文

LifeSentence:语言模型可以根据纵向面板数据编码人类生命历程轨迹

LifeSentence: Language models can encode human life course trajectories from longitudinal panel data

模型训练监督微调与指令调优

摘要

预测人类生活结果对于深入了解个人如何获得长寿和健康的生活非常重要。传统的统计方法的准确性有限,这可能是由于放弃了生命历程的顺序结构。 Transformer 架构等现代方法需要大多数纵向面板研究所缺乏的大规模训练数据。在这里,我们介绍 LifeSentence,这是一种将 大语言模型 与纵向面板数据连接起来的生命历程推理模型。通过将每个生活事件表示为结构化自然语言记录,并在涵盖预测、鲁棒性和推理的 18 项评估分类法中对预训练的 240 亿参数语言模型进行指令调整,LifeSentence 用预训练期间已编码的分布式知识补充了面板数据。 LifeSentence 对来自德国社会经济小组的约 65,000 名个人进行了训练,比之前基于 Transformer 的方法大约减少了 45 倍。LifeSentence 在所有任务系列中都优于经典和深度学习基线,在从最佳基线的联合事件和时间预测方面实现了三倍的改进,并且在从时间戳剥离的事件集中重建时间顺序时,Kendall tau 达到了 91.2%。在没有明确监督的情况下,该模型仅从离散事件序列中恢复记录的社会分层模式,包括教育溢价、性别工资差距和母性惩罚。自然语言界面进一步实现了新的定性研究查询,例如将早期生活史与特定的晚年终点联系起来,将 LifeSentence 建立为预测工具和人类传记反事实探索的探针。