论文

ArchitectureIQ:论训练直觉的衡量标准

ArchitectureIQ: On the Measure of Training Intuition

模型评测基准与评测资源

摘要

顶尖研究人员拥有良好的直觉,但语言模型对模型训练的直觉是否与顶尖人工智能研究人员一样好?为了衡量大语言模型和人类的模型直觉,我们引入了 ArchitectureIQ 基准。每个问题都提供一个合成数据集和几个训练方案,并要求考生预测产生最佳测试指标的方案。总体而言,我们发现LLM的模型直觉很好,但有四个局限性:(1)直觉不完美,在某些情况下甚至低于人类。与最好的人类研究人员 (66.0%) 相比,前沿模型的准确率约为 76%(随机选择 33%),但仍远未达到完美。对于仅架构问题,best human 达到了 65%,而 GPT-6 Astra 仅达到 38%。 (2) 这种直觉是经验性的,而不是结构化的,事实证明更多的 CoT 计算不会带来实质性的改进。与数学不同,我们仍然缺乏一种能够对人工智能进行结构化推理的“人工智能科学”语言。 (3)直觉没有被最大限度地浓缩,可以进一步压缩为知识库。我们构建的知识库只有 20 个项目,但对于弱模型来说却有很大的收益:配备了积累的知识的 GPT-4o 几乎与 Claude Opus 5 的性能相匹配。 (4) 直觉对数据集属性不敏感,但最好的模型通常应该依赖于数据属性。这表明数据才是人工智能中真正的“暗物质”——大语言模型(人类研究人员也是如此)对数据的了解太少,甚至比模型架构还少。