论文
SemPlan:面向企业数据LLM查询的结构化语义规划基准评测
SemPlan: Benchmarking Structured Semantic Planning for LLM-Based Queries over Enterprise Data
摘要
面向企业数据的自然语言接口必须把欠规范的请求转化为受治理、可执行的行为,同时控制无效查询、策略失败、成本和非确定性。SemPlan基准用一个确定性的合成双语基准评估这一架构设计空间,包含1,800个英语与巴西葡萄牙语案例,其中1,200个构成冻结的科学评估子集。在相同模型配置下比较四种架构:直接SQL生成(A1)、有界工具智能体基线(A2)、先生成结构化语义请求再进行确定性规划与执行(A3)、带澄清/有状态语义计划的变体(A4)。在4,800条主记录上,答案正确率的绝对值都偏低:A1为22.25%,A2为22.58%,A3为25.67%,A4为24.25%。A3的观测正确率最高,且在预先设定的配对正确性分析中显著超过A1、A2和A4;而A1保持了最高的策略正确率和最低的不安全或无效率。A4的平均API成本和错误拒绝率最低。在一个预选的150案例稳定性子集上,答案正确的可重复性介于92.00%到98.67%之间。结果支持权衡式解读而非普适排序:附加的结构约束改变了失败模式和效率,但没有单调提升正确性,也没有解决歧义和多轮状态一致性问题。