论文
在 DSGE 模拟器中建立大语言模型以进行政策生成和预测
Grounding Large Language Models in DSGE Simulators for Policy Generation and Forecasting
摘要
大语言模型可以产生听起来合理的经济政策反应,但这并不表明它们的行为与经济动态一致。我们通过将指令调整的语言模型放置在六个 Snowdrop 支持的动态随机一般均衡 (DSGE) 模拟器中来对此进行测试。在每个回合,该模型都会观察经济和经济话语的变化,选择有限的政策行动,并接收下一个模拟状态和经济奖励。我们实现了一个通用的 Python 接口,用于重复部署、持续冲击、状态克隆和滚动范围模拟。这种设置会产生长期信用分配问题。政策效果可能会在采取行动后几个季度显现。 PPO 具有学习价值函数,可以通过广义优势估计将延迟奖励传播到早期词元。 GRPO 没有学习价值函数,而是从完整的部署回报中分配相对于群体的优势。因此,它无法区分哪个较早的回合导致了结果;如果每次rollout都获得相同的回报,则标准化优势为零。我们使用 PPO 作为主要方法,使用 GRPO 作为匹配的无批评基准。这些实验还测试了定向语义信号、奖励范围、轨迹热启动、跨模拟器传输以及历史锚定的流行病和货币政策冲击。目标是通过模拟的经济后果来判断政策行动,而不是仅仅通过貌似合理的语言。