论文
EMRB:评估LLM对原始电磁信号推理的多层级基准
EMRB: A Multi-Level Benchmark for Evaluating LLM Reasoning over Raw Electromagnetic Signals
摘要
大语言模型(LLM)越来越多地被用作科学与工程分析的代码智能体,但其分析原始物理层测量数据的能力尚未被检验。我们提出EMRB(电磁推理基准,Electromagnetic Reasoning Benchmark),评估LLM能否通过编写和运行代码来分析原始I/Q数据。EMRB包含200道题目,横跨五个难度等级和27种题型,从信号检测到OFDM设计,由11种信号类型生成且经过真值验证。与基于预处理特征或结构化表格构建的基准不同,EMRB只提供原始采集数据;每道题所涉及的量必须首先通过代码被发现。我们评估了涵盖闭源、开源权重和推理导向家族的14个LLM。得分从24.1%到78.9%不等,平均分从基础测量任务的84.9%降至系统设计任务的21.2%。我们还提出ReconPilot,一种将信号侦察、定向分析和自我验证相分离的结构化方法。在三个骨干上,ReconPilot将总分提高3.8至17.6分,并在测试的15个骨干级组合中的13个上有所改进。所有数据和代码已公开释出于GitHub仓库(github.com/mingxuZhang2/EMRB)。
