论文

EmailBench:评测企业邮件Agent的端到端任务完成

EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks

智能体系统Agent任务评测

摘要

企业邮件Agent必须结合信息检索、结构化状态修改、时间推理和多步协调。近期Agent基准包含生产力任务,但很少围绕自包含环境中的类型化邮件工作流展开。我们提出EmailBench,包含跨16个任务类别的206个邮件与生产力场景。基准结合类型化邮件API规范、供应商中立命名、受Enron启发的确定性合成语料及场景套件;场景主题选择参考交互原型的汇总任务意图遥测。混合评测协议结合258个可执行静态断言和211项LLM评分规则。我们在固定单用户语料上评估八种语言模型配置。最佳配置仅通过33.5%的场景,尽管其99.7%的工具调用完成且未观察到API失败;不同任务类别的通过率差异明显。这一差距说明,有效工具执行并不等于任务完成。EmailBench为端到端邮件Agent评测提供自包含环境,未来方向包括扩大工具覆盖、多角色测试和重复运行评测。