论文

CODS 2025 AssetOpsBench挑战赛的结果与复盘分析

Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge

智能体系统Agent任务评测

摘要

竞赛回顾在解释排行榜衡量的内容、隐藏的评估如何改变结论以及哪些设计模式获得奖励时非常有用。我们重新审视 CODS 2025 \assetopslive{} 挑战赛,这是一项基于 \assetops{} 的工业多代理编排的隐私意识 Codabench 竞赛。我们结合了最终排名表、300 个提交的服务器日志、149 个团队的注册、最佳提交导出、组织者获胜者报告、配套的 \assetopslive{} 系统论文以及经过验证的规划跟踪源树。有五个结果脱颖而出。首先,公共规划排行榜在 72.73% 处饱和,更丰富的提示并不能改善该峰值。其次,隐藏评估改变了情况:公共和私人得分在计划中适度相关($r{=}0.69$),但在执行中呈负相关($r{=}{-}0.13$),几个 45.45% 的公共执行系统在隐藏集上达到 63.64%。第三,\tmatch{} 项在官方综合数据中在数字上几乎是惰性的 - 结合 0--1 范围和 0--100 百分比分数,它最多为每条赛道贡献 0.05 分,并且重新调整范围将交换前两支球队。第四,比赛在操作上是基于账户的,但实质上是基于团队的:149个注册团队减少到24个公共分数非零的团队和11个完全排名的团队,而52.3%的去重注册列出了多个用户名。第五,成功的执行方法主要改进护栏——响应选择、污染清理、回退和上下文控制——而不是新颖的代理架构。这些发现确定了评估奖励哪些行为,并激励规模感知复合、技能水平诊断和版本化工件发布。

CODS 2025 AssetOpsBench挑战赛的结果与复盘分析:论文配图
图 1:CODS 2025 AssetOpsBench 竞赛框架。根据多模态工业数据的四个领域代理,跨规划和执行跟踪对提交的内容进行评估。蓝星标志着从开放开发阶段到隐藏评估阶段的过渡。