论文

大语言模型 能否预测对社会政策的行为反应?中国灵活就业人员养老金参保预测案例

Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers

摘要

评估社会政策变化的影响是政策制定者广泛承认的挑战。当推断假设情景时,计量经济学方法可能不可靠,而现场试点计划成本高昂。在本文中,我们建议使用 大语言模型 (LLM) 作为改编自通用模型的政策评估工具。我们提出了 FlexPension-LLM,这是第一个针对中国灵活工人分层养老金登记预测任务的领域专业化 大语言模型,并引入了 DKI-RDistill,它在提示中注入了基于政策的线索,包括 Probit 衍生的边际效应和户口省养老金规则。然后,该方法使用 LoRA/SFT 将基本原理增强监督提炼到开放权重的 MoE 学生中,并通过在 真值 标签下重新生成这些案例来纠正教师错误。在 CHFS 2019 盲分中,FlexPension-LLM 实现了 0.9316 综合 F1,超过了其 Claude Sonnet 4.5 老师和 17 个基线中的 15 个,并且在统计上与 Claude Opus 4.6 没有区别。在四次外部调查中,综合 F1 平均值为 0.7549,显示出最强系统中最窄的性能范围。成分分析表明,收益主要来自基于政策的线索注入和错误过滤的监督,而基本原理提供了可以根据政策规则进行检查的决策痕迹。