论文

Sonar-TS:面向时序数据库的先搜索后验证自然语言查询

Sonar-TS: Search-Then-Verify Natural Language Querying for Time Series Databases

摘要

时序数据库自然语言查询(NLQ4TSDB)旨在帮助非专业用户从海量时间记录中检索有意义的事件、区间和摘要。然而现有 Text-to-SQL 方法并非为形状或异常等连续形态意图设计,而时序模型难以处理超长历史。为应对这些挑战,我们提出 Sonar-TS,一个通过“先搜索后验证”流水线处理 NLQ4TSDB 的神经符号框架。类似主动声呐,它利用特征索引通过 SQL 探测候选窗口,再由生成的 Python 程序锁定候选并对照原始信号验证。为支持有效评估,我们提出 NLQTSBench,首个针对 TSDB 规模历史的 NLQ 大规模基准。实验凸显该领域的独特挑战,并证明 Sonar-TS 能有效处理传统方法失败的复杂时间查询。本工作对 NLQ4TSDB 进行首次系统研究,提供通用框架与评估标准以促进未来研究。

Sonar-TS:面向时序数据库的先搜索后验证自然语言查询
图3:Sonar-TS框架概览。工作流分为三个阶段:(1)离线数据处理(Offline Data Processing)构建紧凑的多尺度特征表(Feature Tables)作为可查询索引;(2)在线查询(Online Querying),其中Task Planner与Code Generator合成SQL用于快速候选检索、Python用于精确验证,并由不断演化分析洞见的闭环提示冷启动(Prompt Cold Start)机制支撑;(3)后处理(Post-processing)将执行产物转换为用户友好的界面。