论文

增值税确定中的 LLM-Agent 分解:先导控制扫描

Right-Sizing LLM-Agent Decomposition in VAT Determination: A Pilot Controlled Sweep

智能体系统Agent任务评测

摘要

最近的 LLM 代理系统做出了相互冲突的设计赌注:将工作分解到许多狭窄的代理中,或者使用一个强大的工具使用代理。该试点研究了反向收费的有界跨境增值税确定的选择,其中每个案例都有一个预言机标签,并且每个中间决策都可以独立评分。我们保持活动表面固定(子任务、工具、I/O 模式、验证检查、编排器、基本模型和合并策略),并且仅改变子任务对跨四种编排配置的工作人员的分配,从一个宽工作人员到五个窄工作人员,针对 S0,一个经过调整的无编排器单一代理,具有作为预言机的确定性规则引擎。该计划涵盖 4,400 次运行:40 个案例、五次重复的主要扫描、将即时预算与代理计数效应分开的匹配词元臂,以及三个失败注入臂,所有这些都根据预先注册的伪造标准进行判断。两种中间配置在准确度上领先(0.830,相对于终点为 0.720 和 0.770),但未达到相对于精细终点的预设标准,因此中间最优假设在中试规模上仍然不受支持。单个代理不会帕累托主导编排的集合。匹配词元标准触发:预算匹配的单一智能体比领先者低 6.5 个点,但区间包括零,因此任何优势都与即时预算解释一致。在注入下,可用性故障在每个粒度上都被吸收,大范围的重新启动将其基线恢复了+0.160,而一个符合模式的幻觉记录会降低每个配置并反转顺序,对碎片配置造成最严重的影响。贡献是一种有界的、预先注册的试点启发式,用于正确调整分解大小(将一个分区边界放置在依赖层中点),与预言机、数据集、工具、原始跟踪和分析管道一起发布。