论文

SolarChain-Eval:去中心化能源市场中可信经济智能体的物理约束基准

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

智能体系统Agent任务评测

摘要

随着智能体AI系统日益应用于信息物理环境,其评估需要同时评估任务表现与可信度。在去中心化能源市场中,自主智能体可能改善市场效用,但也可能利用无效物理数据、制造人为流动性并产生不稳定的治理决策。因此我们提出SolarChain-Eval:评估可信经济智能体的物理约束基准。它把市场治理形式化为Gymnasium兼容的马尔可夫决策过程——智能体做逐小时决策。SolarChain-Eval跨多维度评估每个策略:市场效用、物理安全、滑点、动作平滑度、空间公平与可审计性。为支持智能体评估,SolarChain-Eval纳入基于LLM的规划者/审计者层:规划者定义回合级动作界限与审计规则,审计者审查并修订高风险动作。所有干预经结构化日志记录——含触发信号、提议动作、修订动作与审计理由。静态、随机、短视、RL与RL+LLM策略的实验揭示清晰的效用—安全权衡:RL智能体改善市场效用但仍可产生不安全行为;当物理惩罚被移除时,奖励最大化智能体利用无效发电并增加人为流动性。LLM规划者/审计者改善可审计性并缓解选定风险,但无法完全补偿错误指定的奖励函数。结果表明可信智能体AI评估需要物理约束与透明干预痕迹两者。数据与代码已作为开放获取发布于GitHub。

SolarChain-Eval:去中心化能源市场中可信经济智能体的物理约束基准:论文配图
图 1. SolarChain-Eval 总体基准流程。该图总结了去中心化能源市场治理的数据加载、强化学习训练、政策评估、输出生成和可信证据的端到端工作流程。