论文
HouseholdBench:评测 LLM 对家庭经济行为的预测
HouseholdBench: Evaluating Large Language Models as Predictors of Household Economic Behavior
摘要
大语言模型 (LLM) 有潜力实现经济学的一个关键目标:跨各种环境的家庭决策的定量模型。然而,现有的评估涵盖的调查和结果很少,并且没有研究家庭如何适应不断变化的经济状况。我们推出了一项新的评估 HouseholdBench,它整合了 6 项美国家庭调查和 32 项预测任务,涵盖与消费、收入、劳动力、预期和住房相关的数字、分类和概率结果。这些任务使用过去的行为、人口统计和宏观经济条件来测试 LLM 是否可以预测行为,包括家庭如何适应各种策略的变化。我们根据无变化基线和梯度增强树模型评估 13 个专有和 开放权重 LLM。大多数 LLM 的表现优于无变化基线,包括策略响应任务 - 最佳模型将数字结果的误差降低了 12.2%。在大多数任务中,梯度-boosted trees 排名第一;领先的专有 LLM 接近其性能,但 开放权重 型号滞后。 LLM 在不同的任务中表现出系统性的高预测和低预测。我们确定了使 40 亿个参数开放权重 模型能够匹配专有模型性能的方法:微调并聚合每个观察的 16 个预测。改进适用于策略响应任务,这些任务被排除在微调之外。我们在我们的网站上发布我们的数据集、代码和排行榜:https://jn-huang.github.io/householdbench