论文
AcademiClaw:当学生给AI智能体出难题
AcademiClaw: When Students Set Challenges for AI Agents
摘要
OpenClaw生态内的基准迄今只评估助手级任务,学术级能力基本未被检验。我们提出AcademiClaw:一个双语基准,含80个复杂长程任务,直接来源于大学生真实学术工作流——作业、科研项目、竞赛与个人项目——且都是学生发现当前AI智能体无法有效解决的。从230个学生提交候选中经严格专家评审筛选,最终任务集横跨25+专业领域:从奥赛级数学与语言学问题到GPU密集强化学习与全栈系统调试,其中16个任务需要CUDA GPU执行。每个任务在隔离Docker沙箱中执行,以六种互补技术组合的多维量规评分任务完成度,并有独立的五类安全审计提供附加行为分析。六个前沿模型的实验显示,最佳者通过率仅55%。进一步分析揭示了跨任务域的尖锐能力边界、模型间行为策略的分化,以及token消耗与输出质量的脱节,提供了聚合指标之外的细粒度诊断信号。我们希望AcademiClaw及其开源数据与代码能服务OpenClaw社区,推动智能体在真实学术需求全谱系上更强、更通用。全部数据与代码见GitHub。
