论文

Alipay-PIBench:面向编码智能体的真实支付集成基准

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

智能体系统Agent任务评测Agent Skills

摘要

支付集成是一项要求苛刻的仓库级软件任务:智能体必须选择合适的产品、实现协调的客户端—服务端流程、核验支付结果、并在交易与业务状态间保持一致性。我们提出Alipay-PIBench:评估编码智能体在真实支付宝支付集成上表现的基准。含九个产品专属项目与18个任务实例,每个组织为基础功能完成与进阶风险加固两类场景。场景专属量规支持确定性的静态、单元、集成与端到端检查,辅以LLM辅助的语义要求评估。我们评估六个编码智能体模型并报告量规通过率(RPR)。在带技能条件下:平均RPR介于68.58%到91.37%;使用alipay-payment-integration技能相对无技能条件平均提升RPR 10.31个百分点,增益跨模型、产品与场景而异。方法级结果区分源码级完成、可执行支付行为与支付域要求。Alipay-PIBench为诊断模型能力与评估支付集成中的结构化引导提供受控设定。

Alipay-PIBench:面向编码智能体的真实支付集成基准:论文配图
图 1:Alipay-PIBench 框架概述。特定于产品的项目与业务工作流程、初始存储库和集成请求相结合,形成基本和高级任务场景。确定性检查和大语言模型辅助标准源自共享的标准,而配对的无技能和有技能条件则衡量支付宝支付集成的实际效果。