论文

CypherTurn:对话式文本到密码评估和自主分歧的多轮基准

CypherTurn: A Multi-Turn Benchmark for Conversational Text-to-Cypher Evaluation and the Autonomy Divergence

模型评测基准与评测资源

摘要

图形数据库越来越多地通过自然语言进行查询,但每个现有基准测试都评估孤立的单轮查询,而不是分析师实际工作的多轮会话。我们推出了 CypherTurn,这是第一个对话式 Text-to-Cypher 评估基准,包含 721 个会话和 5,927 个回合,涉及 7 个知识图和 13 个对话现象。我们在引导预言机协议和完全自主的 Agentic 协议下评估了 15 个模型,得出了四项发现。首先,最好的模型执行准确率仅为 64.7%,会话级正确率仍低于 5%。其次,尽管总体排名相关性很强,但前沿模型在自主操作下表现出了排行榜顶部的相应重新排序,我们将这种现象称为“自主发散”,它揭示了错误管理是一种部分独立于原始生成技能的能力。第三,将行动预算从 x3 扩大到 x10 无法缩小自治差距,因为最强的前沿模型会自我限制为每回合大约两个行动,而不管可用预算如何。第四,单轮 Cypher 微调会降低多轮指令遵循性能,而适合架构的专门化优于多个前沿模型。这些结果使 CypherTurn 成为对话式图数据库推理的公开挑战。代码和数据可在 https://github.com/BarryQ/CypherTurn. 获取