论文

WaveformQA:基准测试LLM对数字波形的时序推理

WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

模型评测基准与评测资源

摘要

大语言模型(LLM)在代码生成与推理上能力强劲,但对数字波形数据做时序推理的能力基本未被探索。波形推理是设计验证的关键瓶颈,而现有基准主要评估硬件描述语言(HDL)代码生成、仅把波形作为补充上下文。本文提出WaveformQA,一个评估LLM数字波形时序推理的开源问答基准:含360个问题、程序化生成的真值、八个难度递变的类别——包括针对多信号关联与事件排序的问题。波形由开源设计实现生成,保证可复现并把基准落地到真实硬件行为。对前沿LLM的评估显示:模型在简单查询上有合理准确率,但在复杂时序与多步问题上因上下文窗口限制与推理困难而退化。此外我们证明波形的事件时间JSON表示较标准值变化转储(VCD)格式提升LLM推理准确率。开源框架支持扩展新问题类别与导入新波形源,便于研究者快速原型化时序推理实验。

WaveformQA:基准测试LLM对数字波形的时序推理:论文配图
图 2:JSON(青色)和 VCD(金色)格式的上下文错误率 (%) 成对条形图,显示按类别分组的 24 个问题子类别中的每一个。在 Gemini 2.5 Pro 上对所有信号箱进行评估。