论文

AI4Fire:评估野火任务的大型语言模型

AI4Fire: Evaluating Large Language Models on Wildfire Tasks

模型评测应用与实践模型能力评测鲁棒性、公平性与可信度评测行业应用

摘要

大型语言模型(LLM)正在进入野火管理领域,夸大的评估可能会造成财产和生命损失。无论是否接地,它们如何执行野火任务?裸露意味着模型单独接收任务输入。接地意味着它还收到一项特定于任务的附加功能:用于烟雾检测,来自同一摄像机的无烟参考系。 AI4Fire 裸机运行 6 个核心模型,并基于 5 个野火任务,零样本;扫一扫又增加了 29 个。我们对消防任务的文献检索发现了 138 篇作品;没有一个将这个名册、任务覆盖范围以及配对的裸跑和接地跑步结合起来。我们报告了三项发现。 (1) 接地在添加带来答案的地方帮助最大:只读 SQL 工具将每个核心模型的数据库准确性从最多 16% 提升到至少 88%。 (2) 简单的规则很难被击败:没有一个核心模型的表现优于重复今天的人员配置,并且两个开放权重模型大多复制了类似的早期火灾日的中位数,这是一个更糟糕的预测。 (3) 公共释放存在危险:火灾危险柱将抵抗区完美地隔开,67 个空中 防火框架带有阴燃或防火标签,可从最高热值中读取。我们发布提示、回复、分数、代码和调查记录。