论文
当JSON不够用:模式约束LLM下单智能体的语义可靠性
When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents
摘要
LLM智能体日益被用作交易编译器:用户以自然语言陈述意图,模型发出API可执行的结构化对象。JSON模式与提供商级结构化输出模式很有用——它们消除了一大类解析失败——但它们本身并不决定该对象是否是一个安全、忠实的交易。我们提出OrderBench,一个餐厅下单智能体的确定性基准:分离语法有效性、模式有效性、状态决策、精确条目语义、约束保持与不安全接受。对四个开放模型在仅提示与JSON模式两种模式下共2,400次Nebius Token Factory调用的评估发现:模式有效的输出仍可能有很高的语义错误率。在最强模型上,两种模式都达到100%模式有效性,但语义成功仍接近80%;在较弱模型上,模式有效的不安全接受达两位数。结论是一个具体的工程警告:结构化输出是必要的接口层,不能替代领域验证与失败关闭(fail-closed)执行。