论文

将确定性结构编译进SLM Harness

Compiling Deterministic Structure into SLM Harnesses

智能体系统Agent Harness

摘要

小语言模型 (SLM) 的企业部署受到认知不对称的限制:SLM 无法自我纠正推理错误,而前沿 LLM 成本高昂,并且面临大批量使用的数据主权限制。我们提出了语义梯度下降(SGDe),这是一个师生框架,它将代理工作流程编译成离散执行计划,包括 DAG 拓扑、系统提示和确定性可执行代码。后面的“e”将 SGDe 与随机梯度下降区分开来。 SGDe 在一个离散的语义空间中运行,其中前沿教师生成自然语言批评,充当方向梯度,以迭代地完善 SLM 的工作流程制品。我们在 PAC 学习框架内将 SGDe 形式化,建立样本复杂度界限,通过利用教师作为统计先验,能够在目标合成任务上用最少三个训练示例进行收敛。在通过对抗性合成构建的 GSM-Hard 派生测试集上,在推论 1 驱动的小 m 机制中,编译的工作流程在 m=5 时达到 91.3% 的准确率,在 m=3 时达到 99.3% 的准确率,比最先进的提示优化器有 +26.3% 到 +34.3% 的绝对改进。在新兴的线束工程范例中,SGDe 将确定性代码的放置(将子任务委托给 Python 运行时而不是保留为 LLM 调用)作为跟踪驱动的每节点优化目标,概括了 PAL 和 PoT 的整个问题卸载。教师编译了两个互补的确定性结构:能力卸载(当 SLM 无法可靠地执行子任务时将子任务委托给 Python)和结构共识(将方差限制推理步骤包装在通过确定性投票聚合的扇出/扇入子图中)。

将确定性结构编译进SLM Harness
图 3:m = 5 m=5 时具有挑战性的 GSM-Hard 派生测试集的精度比较(详细信息请参见第 V-A2 节;m = 3 m=3 结果显示在图 4 中)。 SGDe 框架的动态工作流拓扑 ( μ = 91.3 % \mu=91.3\% ) 显着优于 DSPy 提示优化器 ( μ = 65.0 % \mu=65.0\% ) 和基线学生代理 ( μ = 48.3 % \mu=48.3\% ) 的静态架构。