论文

Bongard:训练机器直觉

Bongard: Training Machine Intuition

模型训练监督微调与指令调优

摘要

人类智力在很大程度上依赖于习得的直觉:识别模式和判断情况,而无需明确展开每个中间步骤。我们介绍 Bongard,一种开放权重的 System One 模型,它将机器直觉视为一种独立的设计和训练能力。 T5Gemma 2 4B-4B 编码器-解码器将读取证据与做出判断分开。编码器与问题指令一起双向读取状态,并且单独的解码器分支共享这种编码,因此对同一情况的多次判断只需要读取一次状态。经过训练的头部会返回所提供候选的概率,而不生成文本。训练分三个阶段进行,从监督判断到语义关系再到行动结果,每个阶段都会更新一个 Blackwell GPU 上的所有 70.9 亿个可训练参数。联合嵌入后训练将保留改写的准确率从 75.7% 提高到 85.9%。然后,沙箱阶段从操作部署和精确预言中学习结果分布,将冻结沙箱面板的准确性从 50.6% 提高到 64.8%。在 DecisionBench 上,最终模型在 23,900 个决策中达到了 78.05% 的准确率,在公开比较的 61 个系统中排名第四。在一台 RTX PRO 6000 上,短请求的中位延迟为 36 毫秒,有关一种状态的 32 个问题需要 221 毫秒。 Bongard 证明,机器直觉可以通过表征学习和结果反馈进行系统训练,为高吞吐量决策工作负载提供开放、高效的替代方案。