Agentic Jackal:文本到 JQL 的实时执行和语义价值基础
Agentic Jackal: Live Execution and Semantic Value Grounding for Text-to-JQL
摘要
将自然语言转换为 Jira 查询语言 (JQL) 需要解决不明确的字段引用、特定于实例的分类值和复杂的布尔谓词。单遍 LLM 无法发现给定 Jira 实例中实际存在哪些分类值(例如组件名称或修复版本),也无法验证针对实时数据源生成的查询,从而限制了释义或模糊请求的准确性。不存在用于将自然语言映射到 JQL 的开放的、基于执行的基准。我们推出了 Jackal,这是第一个大规模、基于执行的文本到 JQL 基准测试,包含在实时 Jira 实例上经过验证的 100,000 个 NL-JQL 对,并存在超过 200,000 个问题。为了在 Jackal 上建立基线,我们提出了 Agentic Jackal,这是一种工具增强代理,它通过 Jira MCP 服务器和 JiraAnchor 为 LLM 提供实时查询执行功能,JiraAnchor 是一种语义检索工具,可通过基于嵌入的相似性搜索来解析自然语言提及的分类值。在评估的 9 个前沿 LLM 中,单遍模型在短自然语言查询上的平均执行准确度仅为 43.4%,这凸显了文本到 JQL 仍然是一个开放的挑战。代理方法改进了 9 个模型中的 7 个,在最具语言挑战性的变体上相对提高了 9.0%;在受控消融隔离 JiraAnchor 中,分类值准确度从 48.7% 上升到 71.7%,分量字段准确度从 16.9% 跃升至 66.2%。我们的分析将固有的语义歧义(例如问题类型消歧和文本字段选择)确定为主要的失败模式,而不是价值解析错误,为未来的工作指明了具体方向。我们公开发布基准、所有代理成绩单和评估代码以支持可重复性。