技术实践
阿里云用AgentLoop评测编码Harness
概述
阿里云团队以阿里云 AgentLoop 为底座,用 LoongSuite Pilot 经 Cordis 插件机制非侵入接入 DeepSeek Harness 的 Session Log 事件流,在 terminal-bench 2.1 派生的 10 条容器化任务上以 DeepSeek Harness + Qwen3.7-Plus 完成基线执行,并构建任务完成度、红线规则判定、执行过程可靠性三个正交确定性评估器(评分由规则化脚本产出、封装为 AgentLoop 的 AGENT + Skill)完成 3 个评估器 × 10 条任务共 30 次评估、成功率 100%。 DSH 通过 8/10(80%),整体平均分 0.85,三维平均 outcome 0.74、compliance 0.98、process 0.83,Codex 同为 8/10 但失败面与封顶情况不同。