论文

PCFBench:产品碳足迹估算的诊断性基准

PCFBench: A Diagnostic Benchmark for Product Carbon Footprint Estimation

模型评测上下文与知识本体基准与评测资源

摘要

人工智能系统正在部署在高风险、特定领域的工作流程上,这些工作流程不仅要求最终输出的正确性,而且要求每个中间步骤的正确性。其中一个工作流程是估算产品碳足迹 (PCF),即物理产品产生的温室气体排放量。人工智能代理越来越多地被用来生成 PCF,但现有的评估要么对总排放(隐藏错误源并取消错误)进行评分,要么对孤立的子任务(缺少组合交互)进行评分。我们推出了 PCFBench,这是第一个将 PCF 建模分解为需要分解、检索、本体匹配和数值提取的可独立评估任务的基准。它包含 6 个任务中的 614 个专家标记的项目。他们一起探讨在规范不足、上下文冲突和数字限制下的推理。在来自四家提供商的八个前沿LLM中,没有单一模式占主导地位。尽管最强大的模型估计 77% 的产品总产品排放量在申报总量的 2 倍以内,但当 PCF 逐步生成时,这一比率下降到 37-58%,只有 45-75% 遵守质量守恒定律。这些失败破坏了从业者比较产品和推动脱碳所需的透明度。我们发布数据集和评估工具来支持目标进展。

PCFBench:产品碳足迹估算的诊断性基准:论文配图
图2:PCF BENCH数据集概览。(a) 类别覆盖范围:六项可评价任务的产品类别。数字和阴影表示索赔/项目计数;颜色编码对数(计数+1)\log(\ text{计数}/1)。家具、建筑、车辆、电力和燃料以及服务都装在“其他”项下(附录C)。(b) 千克CO2e分布:任务7中175种环境设计中每公斤的辛醇-水分配系数直方图为千克CO2e。