论文
Text-to-Python与Text-to-SQL对比基准:显式逻辑与歧义的影响
Benchmarking Text-to-Python against Text-to-SQL: The Impact of Explicit Logic and Ambiguity
摘要
尽管 Text-to-SQL 仍是数据库交互的主导方法,真实世界分析日益需要 Python 或 Pandas 等通用编程语言的灵活性,以管理基于文件的数据与复杂分析工作流。尽管需求增长,Text-to-Python 在核心数据检索上的可靠性相对于成熟的 SQL 生态仍未被充分探索。为填补这一空白,我们提出 BIRD-Python,一个为跨范式评估设计的基准。我们系统精炼原始数据集以降低标注噪声并对齐执行语义,从而建立一致且标准化的比较基线。我们的分析揭示一个根本的范式分歧:SQL 通过其声明式结构利用隐式 DBMS 行为,而 Python 需要显式过程逻辑,因此对欠规约的用户意图高度敏感。为缓解这一挑战,我们提出逻辑补全框架(LCF),通过把潜在领域知识纳入生成过程来消解歧义。实验结果表明:(1) 性能差异主要源于缺失领域上下文,而非代码生成能力的固有局限;(2) 当这些差距被弥补时,Text-to-Python 达到与 Text-to-SQL 的性能持平。这些发现确立 Python 作为分析智能体的可行基础——前提是系统能把歧义的自然语言输入有效接地到可执行的逻辑规范。资源见 https://anonymous.4open.science/r/Bird-Python-43B7/。
