论文
DI-Bench:为企业Agent系统生成领域内数据智能基准
DI-Bench: Systematically Generating In-Domain Data Intelligence Benchmarks for Enterprise Agents
摘要
在特定领域的基准上评估企业智能体至关重要,但公共基准很少评估智能体是否可以将业务知识与分析计算相结合,并且手动构建此类基准的成本很高。我们推出 DI-Bench,这是一个为数据智能 (DI) 生成现实基准的管道,即从大量企业数据中提取见解的实践。为了模拟需要计算和知识检索的实际 DI 任务,DI-Bench 在数据表、维度、指标和文档上构建工件链接图,以形成涉及结构化数据和相关知识的问题。事实答案是通过查询执行得出的,然后是 LLM 问题生成和验证。该管道应用于两个公共数据集,生成包含 731 个任务的基准,涵盖知识检索、分析计算和基于规则的推理。为了显示基准的区分能力和难度,我们评估了四个模型,揭示了一个重大发现:在执行检索的业务规则修改计算的计算任务时,模型仅实现 32% 的准确度。
