论文
Harness何时胜过模型规模,阅读何时胜过二者
When Harness Beats Scale, and When Reading Beats Both
摘要
我们描述了我们的 DocSem 系统(DocInsights 2026 上基于文档的定量推理共享任务),并分析了它在标记数据上成功但在测试集上失败的原因。该管道将混合块检索与沙盒解释器中执行的思维程序 (PoT) 生成、自一致性采样以及块级知识图的实体丰富结合起来。在我们的留出划分中,应用程序架构对指标的影响远远超过模型规模:PoT 为紧凑的 7B 模型增加了 0.282联合准确率,但最多为 72B 模型增加了 0.005,而具有完整Harness的 27B 模型与 72B 相匹配(0.884 vs.\ 0.873),参数减少了大约 2.7$\times$,CO$_2$ 的四分之一。我们通过世界知识和语言知识之间的区别来解读这一点,世界知识随着参数的变化而急剧变化,而语言知识则随着参数的变化而缓慢变化,并表明结构化输出训练可以使紧凑模型能够接入Harness,而不仅仅是小型模型。在栅格、带水印的测试 PDF 上,同一系统的联合准确率下降到 13.58\%(排名 149,共 163 个);验证集的受控重新渲染可重现崩溃的 OCR 一半,同时限制模拟遗漏的内容。审核评估输入的物理性质先于架构,排行榜的双峰性与阅读质量一致,而不是推理,分离了领域。