论文
用于安全数据提取的 大语言模型 基准测试
Benchmarking Large Language Models for Safety Data Extraction
摘要
由于异构文档格式和传统基于规则的方法的局限性,从安全数据表 (SDS) 中准确提取结构化信息在工业安全领域仍然具有挑战性。这项研究对自动 SDS 数据提取的最先进的 大语言模型 (LLM) 进行了基准测试,比较了基于文本的处理流程和多模式处理流程。我们系统地评估了四种模型:Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet 和 Llama 3.1-70B,涵盖三种提示策略:零样本、少样本和思维链。该评估框架评估了 50,000 多个提取的数据字段的准确性、延迟和成本。结果表明,基于文本的提取在所有指标上始终优于多模式处理。 Gemini 1.5 Pro 结合思想链提示实现了最高准确度 (84%),优于 GPT-4o (81%) 和 Claude 3.7 Sonnet (79%)。然而,没有任何模型超过可靠的实际部署通常所需的 90% 准确度阈值。这些发现表明,通用 LLM 对于无监督工业用途来说还不够强大,尽管性能表明特定任务 微调 具有强大的潜力。未来的研究应侧重于领域适应训练、模型校准和人在环验证的集成,以确保安全关键的可靠性。