技术实践

Snowflake 联合多所高校发布 MADQA 基准衡量智能体推理的算力代价

智能体系统上下文与知识上下文工程Agent任务评测

概述

Snowflake 与牛津大学、北卡罗来纳大学教堂山分校(UNC-Chapel Hill)、CVC 及 Hugging Face 等学术与产业伙伴联合构建 MADQA(多模态智能体文档问答)基准,要求智能体在大规模文档集上迭代检索、汇聚视觉与文本证据并完成推理。该基准记录完整搜索轨迹而非只看最终答案,并结合由 Kuiper 统计量改造的指标,衡量系统是否理性投入算力而非暴力穷举,题目全部由人工撰写并严格锚定文档集,多数需理解表格、表单盖章日期等视觉结构。评测显示,简单智能体搭配先进 LLM 达到82.2%的准确率,比强静态 RAG 基线高4.6个百分点,但最强智能体最多需9轮检索才达到约82%的准确率,而人类通常1至2轮即可,相当于智能体要多付出约5倍努力;人类首次查询答对约50%的问题,表现最好的 Gemini 3 Pro 智能体首查仅约12%,且约20%的问题人类与模型都未能解决。无约束递归语言模型的代价更突出:基于 Claude Sonnet 4.5 的 RLM 消耗超2.7亿输入 token、成本约850美元,仍未超过用同款模型构建的更便宜的受限智能体。该工作目前为研究性基准发布,尚未涉及生产部署,结论出自厂商博客自述。