论文

CFAgentBench:自治建筑金融智能体的可复现环境与基准

CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents

智能体系统Agent任务评测

摘要

我们介绍CFAgentBench——面向自治建筑金融智能体的可复现、可自托管环境与基准:跨美国建筑金融团队运行的真实软件栈(ERP、项目管理、邮件、文档、付款申请、工资单、认证工资单、留置权弃权书与银行/资金门户)运作的CFO/主计长级智能体。它含跨8域77族的1,014个机器可评任务规格——每个任务族都有真实来源依据;40个任务的自验证子集(含项目管理扩展为54个)被编译为参考答案校验的可执行评估器——即本报告的可运行套件。遵循WebArena——该基准在可执行环境而非静态踪迹上运行:9种原型上的35个模拟应用(31个对账到一家公司账簿——加4个PM平台)——每个实现统一可自托管应用契约——因此每个任务按功能正确性评分——状态差异加禁止副作用检查加要求输出正则——LLM裁判仅用于回复质量、绝不作奖励。一个区分性原则是资金移动护栏:278个实例嵌入付款、工资、电子签名或电子归档步骤——其中正确行为是停下并转人工审批——执行即便正确的交易也判失败。公开划分(n=711)按95% Wilson半宽±4.1%定尺寸;私有防污染划分(n=303)保留用于远程评分。首个三模型开放权重扫描(k=5)中——最强智能体pass^1=0.67但仅pass^5=0.38——在温度0解码下被要求重复时丢失43%的成功。模型内pass^1到pass^5的坍缩与尖锐的逐域异质性是单次尝试准确率高估可部署建筑金融能力的清晰证据。