论文
SQBench:评估语言模型智能体在生产导向工作流中任务交付的基准
SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows
摘要
现有的大语言模型评估覆盖知识、推理、编码和工具使用,但很少把受约束工作流中产出的可验证交付物当作评估单元。我们提出SQBench,一个评估语言模型智能体生产导向任务交付的基准。SQBench v1.0包含220个标准化任务,组织为L1原子能力、L2复合技能和L3业务场景。每个任务要求智能体处理输入资产、使用可用工具,并产出被明确规定的交付物。评估先计算功能性完成度(Completion),然后从10维风险矩阵(10D Risk Matrix)中由独立证据触发的条目推导风险罚分(Risk Penalty)与绩效(Performance)。严格通过(Strict Pass)要求Completion=1且Risk Penalty=0。我们在统一协议下评估27个模型配置,每个配置-任务对运行一次。预设的最高加权Pass@1为60.5%。L3上的平均严格Pass@1为18.5%,且所有配置在L3上的表现都差于L1和L2,表明在领域约束下的交付是当前任务集上的共同弱点。在2,348个Completion=1的结果中,113个(4.8%)因不可验证的引用、不当的资源使用或格式违规等风险而未达严格通过标准。这些结果表明,仅凭功能完成度不足以完整刻画交付质量,风险判定应单独报告。
