论文

基于验证器的热能存储控制推理模型强化 微调

Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control

模型训练奖励建模与过程监督

摘要

建筑物预计会根据电网状况改变冷负荷。热能存储(TES)可以实现这种转变,但要妥善安排它需要在存​​储限制下提前几个小时进行规划。模型预测控制 (MPC) 和强化学习很难跨建筑物扩展。相反,本研究通过具有可验​​证奖励的强化学习(RLVR)来采用开放权重推理模型。我们将精确的离线动态编程(DP)动作值转换为每个候选动作的密集奖励。强化 微调 (RFT) 仅使用 30 个训练提示,将模型训练为上层调度程序,根据基于文本的状态和预测输出每小时热泵设定点。评估使用特意简单的办公楼 TES 基准,其中精确的 DP 易于处理并且最佳值已知。 RFT 将开放权重模型的排放量从 70.5 千克二氧化碳减少到 61.2 千克二氧化碳,接近 DP 最佳值 60.8 千克二氧化碳。 GPT-5 在没有特定任务训练的情况下几乎与 DP 和 MPC 相匹配,而 GPT-4o(一种非推理 LLM)产生的排放量高于无存储基线,因此推理时间推理显得很重要。跟踪分析表明,RFT 主要稳定可观察的规划模式(候选比较、前瞻和可行性检查),而不是创建新策略。鲁棒性和泛化测试阐明了转移的内容:强化规划模式在预测误差和不可见的 TES 条件下持续存在,并延续到电池任务,但其不同的结构限制了收益。基于DP的可验证奖励提供了一种将开放权重推理模型应用于构建存储调度的实用方法。这些结果激发了对整个建筑控制的更高保真度测试和城市规模能源管理的可扩展验证器。