技术实践

Arize用Harbor沙箱与Phoenix追踪改进编码Agent评测

AI 基础设施智能体系统Agent任务评测Sandbox可观测性

概述

Arize Phoenix团队开发PXI编码Agent时,发现单轮固定样例无法覆盖真实页面、当前时间、前端状态和数据库变化。团队将任务改为Harbor任务:每次启动新的Docker或云沙箱,写入真实Phoenix追踪数据,让Agent调用实际端点,再由验证器读取数据库判定结果;PXI、Claude Code和Codex在同一组任务上比较奖励、轮次与工具调用。Phoenix插件把数据集及其版本、实验结果、基础设施是否正常的注释和完整执行轨迹关联保存,便于把运行环境故障与Agent任务失败分开。复核轨迹时,团队发现Codex虽然得到正确结果,错误分析技能却引导它做了不必要的长时间诊断;于是修改提示和技能,并在同版任务上对照重跑。可借鉴之处在于真实状态、确定性结果验证与过程追踪一起进入迭代闭环。该披露来自开发团队自身,未提供企业业务收益或通用节省比例,复用仍依赖沙箱准备、数据版本及验证器覆盖。