论文

FinCUABuild:Agent能否构建可靠的动态金融计算机使用基准

FinCUABuild: Can Agents Build Reliable Benchmarks for Dynamic Financial Computer Use?

智能体系统Agent任务评测

摘要

金融场景多种多样且复杂,涉及不同的数据条件、工具配置和工作流程。然而,现有的 CUA(计算机使用智能体)评估任务仍然主要是手动构建的,限制了现实世界金融场景的可扩展覆盖范围。那么,智能体能否针对金融场景自主构建多样化的CUA评估任务呢?评估这种能力提出了三个关键挑战:构建请求的场景覆盖、构建方法之间的公平比较以及生成任务质量的可靠评估。为了解决这些问题,我们引入了 FinCUABuildBench,这是一个评估财务 CUA 任务构建的基准,其特点是:(i)576 个构建请求,涵盖 24 个财务工作流程和三种类型的运行时变化; (ii) 标准化投入、预算和产出规格; (iii) 基于执行测试和质量检查的任务资格机制。我们进一步介绍了 FinCUABuildAgent,一个用于自动构建动态金融 CUA 评估任务的多智能体系统。它由共同构建任务、环境和验证器的三个模块组成。在FinCUABuildBench上,在相同模型骨干下,现有基于Agent的构建方法严格合格率仅为1.3-8.3%,而FinCUABuildAgent达到31.3%。下游评估进一步表明,构建的任务可以有效区分CUA任务执行能力。这些结果表明,智能体可以自主构建具有有意义的评估价值的金融CUA任务,为在金融场景中更广泛的评估覆盖范围提供了一条实用途径。代码:这个https URL