论文

工具增广LLM智能体在真实世界能源分析任务上表现如何?

How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?

智能体系统Agent任务评测

摘要

智能体基准已在通用与领域特定设定中涌现——包括金融、编码、法律与药物发现——但能源域评估仍大体局限于静态知识回忆。对一个需要实时数据检索、专门监管与市场知识、以及真实约束下多步定量推理的行业而言——这是关键缺口。我们对工具增广LLM智能体在真实世界能源市场分析任务上开展实证研究。我们的评估环境含243个专家策展问题——横跨三类:(1) 市场数据检索与分析;(2) 知识检索与解释;(3) 高级定量建模与决策分析。任务包括价格与需求分析、电价影响建模、资产收入与回报估算、对冲策略分析与优化建模——问题横跨多难度层级。智能体配备可配置的领域工具套件——包括美国主要ISO的实时电力市场API、监管案卷检索、公用事业电价数据库、资产优化模型——以及对能源市场文档的检索增强生成。我们以多维评估协议评估智能体响应——对方法正确性、答案准确性、属性对齐与来源有效性打分——并以类别感知路由使评分标准匹配问题类型。我们评估闭源与开源LLM——提供模型能力与领域工具在高风险专业域中如何交互的比较分析。关键工件公开发布以支持可复现性与未来研究。