论文

Profile-Then-Reason:面向工具增强语言智能体的有界语义复杂度

Profile-Then-Reason: Bounded Semantic Complexity for Tool-Augmented Language Agents

智能体系统Agent Harness

摘要

使用外部工具的大语言模型智能体常以反应式执行实现,即每次观察后都重新计算推理,这增加了延迟和对误差传播的敏感性。本工作提出Profile-Then-Reason(PTR),一个面向结构化工具增强推理的有界执行框架:语言模型首先合成一个显式工作流,确定性或带守卫的算子执行该工作流,验证器评估所产生的轨迹,只有当原工作流不再可靠时才调用修复。文中发展了一种数学表述,将完整流水线表示为画像、路由、执行、验证、修复和推理算子的组合;在有界修复条件下,语言模型调用次数在标称情形下限制为两次,最坏情形下为三次。在六个基准和四个语言模型上与ReAct基线的对比实验表明,PTR在24个配置中的16个取得成对精确匹配优势。结果表明,PTR在以检索为中心和重分解的任务上尤为有效,而当成功依赖大量在线适应时,反应式执行仍是更优选择。

Profile-Then-Reason:面向工具增强语言智能体的有界语义复杂度:论文配图
图 2:数据集级平均精确匹配差异 Δ​EM=EMPTR−EMReAct\Delta\mathrm{EM}=\mathrm{EM}_{\mathrm{PTR}}-\mathrm{EM}_{\mathrm{ReAct}},对四个评估的语言模型进行平均。正值表示 PTR 优势,而负值表示 ReAct 优势。 PTR 更适合以检索为中心和分解繁重的任务(NQ-Open、TriviaQA、GSM8K、StrategyQA),而 ReAct 在 AQuA-RAT 和 HotPotQA 上保持优势,这些任务的成功更多地取决于符号灵活性或在线搜索细化。