1GC-7RC:一张显卡——七个研究挑战!人工智能代理的工作表现如何?
1GC-7RC: One Graphic Card -- Seven Research Challenges! How Good Are AI Agents at Doing Your Job?
摘要
自主 AI 编码智能体 正在成为工业和研究领域的 ML 从业者的核心工具。尽管采用率不断提高,但仍然没有标准化的基准来评估他们在不同领域从头开始设计、实施和训练模型的能力。我们推出**1GC-7RC**(*单显卡:七项研究挑战*),这是一个基准,包含七个 ML 任务,涵盖语言建模、图像分类、语义分割、图形学习、表格预测、时间序列预测和文本分类。每个任务都提供锁定的数据准备和评估脚本以及基线训练脚本;代理只能修改训练代码,无法访问预训练权重(语义分割有一个受控例外),无法访问互联网,并且必须在单个 GPU 上在特定于任务的挂钟预算(40-120 分钟)内完成每项任务。我们评估了七个 编码智能体:五个专有(使用 Sonnet 4.6、Opus 4.6 和 Opus 4.7 的 Claude Code;使用 GPT 5.5 的 Codex CLI;以及使用 Qwen 3.6+ 的 OpenCode)和两个开源(使用 Kimi K2.5、Kimi K2.6 的 OpenCode)。在每个代理-任务对的 5 次运行中,我们报告了显着的性能差异,揭示了不同水平的隐式 ML 知识、规划能力和时间预算管理。基准测试、工具和所有评估工件均可在 GitHub 上公开获取:https://github.com/Strolchii/1GC-7RC-Benchmark,以便于未来代理的可重复比较。由于我们的基准测试设计是模块化的,因此基准测试可以扩展到新的任务和领域,适应不同的 GPU 预算,并用于研究多智能体设置,使其成为未来自主研究智能体研究的灵活平台。