论文

OccuReward:LLM 引导以居住者为中心的奖励塑造,以实现网格交互建筑中的人口公平

OccuReward: LLM-Guided Occupant-Centric Reward Shaping for Demographic Equity in Grid-Interactive Buildings

模型训练奖励建模与过程监督

摘要

大语言模型 (LLM) 在为基于深度强化学习 (DRL) 的建筑能源管理生成奖励函数方面表现出了良好的能力。然而,它们在不同人口群体中表现出或加剧居住舒适度差异的潜力仍有待探索。我们提出了 OccuReward,一个研究 LLM 介导的奖励设计如何影响人口公平的框架。我们的贡献有三方面:引入舒适资产指数(CEI)作为一种新颖的反馈信号;一种迭代的、具有公平意识的 LLM 奖励塑造方法;以及在这些细化目标下 DRL 代理的性能分析。利用 ASHRAE 全球热舒适数据库 II(13,440 票)中的四个基于经验的居住者档案,我们在 CityLearn v2 中部署了 Soft Actor-Critic 代理。我们的方法采用 Gemini API 在三轮细化中生成奖励函数逻辑和权重,而不是执行每步推理。 15 次实验的结果表明,老年女性住户在最初几轮中的满意度始终最低。到第 3 轮,股权意识 LLM 细化激活了特定的奖励成分,提高了年轻男性 (+17.6%)、中年女性 (+28.2%)、健康敏感者 (+53.8%) 和老年女性 (+567%) 的满意度,同时降低了 3.2% 的能源成本。我们的研究结果强调,虽然奖励水平干预显着提高了公平性,但人工智能驱动的控制器中的人口差异仍然存在,因此需要进一步研究构建系统中的算法公平性。