论文

多轮文本到 SQL 的内存架构:基准和实证研究

Memory Architectures for Multi-Turn Text-to-SQL: A Benchmark and Empirical Study

模型评测基准与评测资源

摘要

多轮文本到 SQL 是企业分析的核心,但仍主要在单轮设置中进行评估。我们推出了 EnterpriseMem-Bench,这是一个多回合文本到 SQL 基准测试,包含 300 个会话和 1,400 个回合,以编程方式从三个企业域(BIRD Financial、SEC EDGAR、Northwind)构建,具有确定性 真值 和每回合内存关键注释。我们评估了五种前沿模型——GPT-5 mini、GPT-5.2、Claude Sonnet 4.5、Sonnet 4.6 和 Opus 4.6——跨越五种记忆条件,实现三向消融,将工作记忆窗口大小、情景检索和语义增强隔离为独立效果。所有 Claude 模型均通过扩展思维进行评估,以保持与 GPT 推理模型的同等性。我们引入内存效益分数(MBS)作为每轮诊断指标。出现了四个发现:(1) 在所有五个模型中,无状态多轮文本到 SQL 的执行精度在第 3 轮时崩溃至零,即使在推理下也是如此; (2) 内存架构复杂性不会单调提高准确性——工作内存占主导地位,附加组件会产生+14% 到-16% 的模型和数据集相关效应; (3) 在各种条件下,Claude Sonnet 4.6 在 SEC EDGAR 上的表现比 Sonnet 4.5 低 17-33 个百分点,在推理下仍存在代际回归; (4) 在推理下,克劳德误差分布变成单模态——每个不正确的转弯都是一个错误结果的误差。我们发布基准、代理和评估代码。