论文

WinSyn:一种用于现实企业问答评估的自动化流程

WinSyn: An Automated Pipeline for Realistic Enterprise Question-Answering Evaluation

模型评测基准与评测资源

摘要

企业环境为问答智能体带来了巨大挑战,这些智能体常依赖检索增强生成、深度研究(DR)等技术。挑战源于企业数据的复杂性:信息通常分散在不断演进且可能冲突的邮件、聊天记录、文档等中。现有基准测试通常缺乏现实场景的复杂性,响应形式简短,查询不自然,难以反映企业环境的真实挑战。本文提出一种自动化流程,用于生成反映真实工作场景的邮件合成数据集,包含长格式和短格式问题及基于数据的参考答案。该方法模拟持续数月、涉及最多25名不同角色员工参与的长期企业项目。数据强调模糊性、信息分散性和自然发生的问题。为验证该流程,我们使用最新前沿模型评估了若干标准智能体基线,在各数据集上的综合得分均低于80%,表明仍有显著提升空间。这些结果表明,企业部署仍需大量工作,凸显了构建真实、高复杂度评估数据对开发更强大的现实企业深度研究系统的重要性。

WinSyn:一种用于现实企业问答评估的自动化流程:论文配图
图 1:管道从种子文档(例如时事通讯)开始,并根据其内容创建组织结构。它们都用于创建 Epics 的 DAG,每个 Epics 都扩展为任务的 DAG。每个任务都涉及其持续时间的每日日志,然后生成电子邮件,然后是问题答案和电子邮件的归属