论文

工具构建:通往“超级智能”之路

Tool Building as a Path to "Superintelligence"

模型评测基准与评测资源

摘要

Diligent Learner 框架表明,只要步成功概率 γ 足够,LLM 可以经由测试时搜索实现超级智能。在这项工作中,我们设计一个基准,在逻辑分布外推理上测量 γ。我们构建了一类 GF(2) 电路重建任务,其难度随推理步数递增,且从信息论角度看,除非 LLM 仔细整合所提供的全部信息,否则不可能可靠求解。我们的分析表明,小 LLM 的 γ 值随深度增加超线性下降,而前沿模型在该任务上表现出部分鲁棒性。此外,我们发现大规模下的成功推理取决于精确的工具调用,从而识别出工具设计是 LLM 经由 Diligent Learner 框架实现通用超级智能的关键能力。

工具构建:通往“超级智能”之路
图8:随着 g g 与 p p 的增大,具有不完美信息的估计器的概率开始坍缩至零。只有估计器 𝒜 \mathcal{A} 能够持续生成下一个单项式。上述热力图通过为每组超参数组合生成 200 200 个电路并计算每个 p p 对应的 γ g \gamma_{g} 而构建。此图展示的是不使用对抗性数据集构建时的性能。