论文
什么驱动了智能体文本到cypher的恢复?LAST-CQ:一种LLM智能体自优化框架
What Drives Recovery in Agentic Text-to-Cypher? LAST-CQ: An LLM Agent Self-Refinement Framework
摘要
针对结构化查询生成的智能体流程,我们使用LAST-CQ——一个五智能体、无需训练、基于执行的文本到cypher框架——作为可监控的测试平台,对2471个实时数据库查询运行了三个反事实实验,涉及六个骨干模型,跨越供应商的三个规模层级。移除纠错操作在单次通过系统上使执行BLEU平均下降3.1%,在无优化反事实中下降12.3%(最弱模型可达80.7%)。用原始数据库错误字符串替代基于模式的LLM合成反馈,性能代价几乎为零(精确匹配从20.9%降至19.9%;端到端性能下降小于0.2%;通过双单侧检验,F1分数在±0.075内等价)。在相同LLM调用预算下,采用并行采样反而使质量下降10-11%。有效的方法是检测失败并将其路由至重试,而非依赖反馈复杂度或采样数量。LAST-CQ本身能恢复单次生成失败查询的91.7%,而首次成功查询仍恰好消耗一次LLM调用。我们还发现,序列化结果中的n-gram重叠并非上下限的可靠指标:在65.9%的结果中,其评分高于集合等价性,而在其他情况下则低于语义判断。最后,我们通过盲法人工标注校准了LLM判别器,发现其存在9点乐观偏差。
