论文
求是引擎在 AstaBench E2E-Bench-Hard 上的表现
Qiushi Engine on AstaBench E2E-Bench-Hard
摘要
本报告分析了求是引擎 v0.8 在 AstaBench E2E-Bench-Hard 中所有 40 个测试任务的情况,该基准要求自主智能体通过实验设计、代码实现、实际执行、结果分析和报告交付来承载研究问题。求是引擎可进行模型配置;本次评测选择DeepSeek deepseek-v4pro-preview作为模型后端。官方 AstaBench 排行榜记录的得分为 0.816,每个任务的平均基准成本为 15.209 美元,而全精度本地重新计算为 81.59 美元 \pm 1.87$。有四项任务满足每个标题项,完整任务完成率为 4/40 = 10%——高出了 7 个百分点,大约是 AstaBench 官方智能体报告的最佳完成率大约 3% 的 3.3 倍。在 507 个必填项目中,416 个项目感到满意 (82.1%)。官方评分档案和 40 个 Meta-Trace 记录显示报告、代码和实验工件的持续生成和验证;主要差距在于重复运行、外部依赖性、指定指标和消融研究。该报告解释了基准、系统工作流程、汇总结果、代表性案例和解释的局限性。