论文

推理如何组织:信息、资源约束与AI生产

The Organization of Inference: Information, Resource Constraints, and AI Production

智能体系统Agent任务评测

摘要

推理的经济价值取决于能力与任务信息如何分布在AI生产的不同阶段。我们用外部可验证的软件工程任务上的受控工作流实验,研究这些组织层面的调整。在两个资源配对实验组中,逻辑Token上限为12,000和24,000时,直接执行的成功率均为59.6%,而信息受限规划的成功率从36.2%上升至51.2%。规划的劣势缩小15.0个百分点(按任务聚类自助采样的95%区间为4.2—25.8)。另一组严格只读的规划实验改变规划器是否能够看到任务问题。在12,000 Token下,允许访问问题比隐藏问题的规划成功率高约16个百分点。与直接执行相比,掌握任务信息的规划在12,000 Token下约低10个百分点,在24,000 Token下则领先29.6个百分点。在资源实验组中,直接执行的用量明显低于两种上限;规划工作流触及预算限制的比例从46.2%降至0.8%,下游执行占总用量增量的89.9%。规模决定系统可用能力,工作流和信息结构则塑造这些能力的生产价值。