论文

A Frozen 12B 在经过验证的工作中击败前沿模型:100% 准确度、0 词元、比特精确、永远

A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

摘要

如今,改进语言模型意味着对其进行重新训练:巨大的计算、每个周期一个新的不透明模型、不确定的输出。我们采取相反的路径:模型保持冻结状态,经过验证的解决方案的持久记忆在其旁边增长。一旦问题系列得到解决并通过了从不查阅答案密钥的独立验证步骤,该系列的每个新实例都会以零代词元得到位精确、确定性的答案。在跨越 9 个问题系列的 180 个新实例中,来自四个供应商的四种架构(密集和专家混合)每个答案的零代词元得分为 180/180:执行绑定功能与参数扩展解耦。负控制将能力完全归因于记忆:清空后,它什么也解决不了。同样的存储前验证合同适用于开放式推理:所有四种模型的一致性门控接受率为 88/88,机器检查的形式证明以及推理方法转移率为 77/80。内存选择需要1.4微秒;在 36 mWh 的情况下,完全重用可在 6-23 毫秒内完成。在经过验证的 4,500 件商品商店中,近似相似性检索在 94.3% 的情况下会选择错误的商品,其中精确寻址可实现零错误。该存储还充当工作环境,其规模是任何已发布的引擎都无法匹敌的:在平坦内存的单个 46 GB GPU 上有一个 6,000,000 个词元的可移动窗口,其中 vLLM 在 30,399 个词元处停止,而 SGLang 会默默地截断超过 32,000 个词元。在已发布的基准测试中,前沿模型在从头开始的推理方面仍然远远领先于任何 12B;对于该系统已解决和验证的所有内容,比较是相反的:前沿 API 调用永远为每个查询支付新的生成传递,而经过验证的重用成本为零,并且每次都返回相同的位。本报告附带一个可免费、限速访问的公共测试平台:https://corbenic-galahad-bench.hf.space