论文
多传感器物理危害评估的大语言模型基准测试
Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment
摘要
我们提出一个实证基准,评估五个大语言模型如何评估多传感器物理危害数据。测试跨三类60个场景——多传感器联合评估、响应比例性与模式消歧——温度0.0下1,800次API调用。我们发现:在多个传感器同时升高但均低于各自安全限的受测场景中,所有受测模型一致未产出任何预警信号;而在单传感器阈值越限场景上接近满分。五个模型(ChatGPT-4o、Gemini 2.5 Flash、DeepSeek、Kimi、Llama 3.1 8B)在A类多传感器场景得分近零(Q2: 0.000–0.208;Q3: 0.000–0.592),对比单传感器场景的强势表现(B类Q1: 0.975–1.000)。结构化表格格式相对平实散文无一致优势;ChatGPT-4o在散文下显著更好(p=0.001)。这些发现对在物理安全监控系统中部署受测模型的从业者有直接含义。
