论文

EnterpriseClawBench:基于真实工作会话的企业Agent评测

EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions

智能体系统Agent任务评测

摘要

企业Agent在工作空间中读取多类文件、调用工具并交付业务产物。EnterpriseClawBench从大量私有真实工作会话中构建852项可复现任务,分别配套恢复的测试材料、重写后的提示、角色类别、技能子类、硬性规则和语义评分标准。由于会话包含企业内部内容,作者不发布基准数据,可复用贡献是构建和评估协议。最佳配置Codex搭配GPT-5.5得分仅为0.663。研究强调,企业Agent评估需报告运行框架与模型的组合、产物交付、视觉质量、成本、运行时间及技能迁移行为,而不只给出单一分数。代码:https://github.com/FrontisAI/EnterpriseClawBench。